首页 > 传媒 > 关键词  > 商汤日日新最新资讯  > 正文

商汤SenseNova U1图文交错增强版:支持多页连续创作,角色风格不“跑偏”

2026-06-13 18:18 · 稿源: 站长之家用户

商汤日日新 SenseNova U1系列新成员——U1-8B-MoT-Interleaved 图文交错增强版模型,面向图文交错创作与生成(Interleaved Generation)场景进行了专项强化,更好地支持绘本、故事书、多页 PPT、图文教程等连续内容创作,解决传统多模态模型“多轮生成后角色形象飘移、画风断裂、图文脱节”等痛点。

核心突破:从“单张高质量”到“连贯图文长序列”

SenseNova U1图文交错增强版的核心能力表现在:能够在长内容场景中,持续输出风格统一、叙事连贯、图文高度对应的多页结果 ——它不再仅仅生成孤立的单张图像 ,而是一套完整的、可直接使用的图文内容序列 。

其核心升级主要体现在四个方面:

1、叙事一致性与角色连贯性大幅提升

模型显著提升了长周期创作中的叙事连贯性、角色一致性与画风统一性。故事线在整个生成过程中被严格遵循,人物形象从第一页到最后一页均保持高度一致,彻底解决了此前多轮生成中角色形象“走调”的核心痛点。

2、图文对应关系增强,告别“图文脱节”

经过专项训练,模型大幅改善了图像内容与文字描述之间的语义对齐能力。生成的画面能更准确地呈现文本所描述的复杂场景、动态动作与物体间的空间关系,有效减少了“图文脱节”的现象。

3、视觉质量与Artifact明显改善

针对人物结构、文字渲染、页面排版等高频高难区域进行了定向优化,显著降低了生成物中的视觉瑕疵(Artifact),使复杂图文混排内容更加自然、稳定和可用。

4、全新能力:多页 PPT 自动生成

新版本首次支持了多页 PPT 自动生成能力。模型能够智能从输入内容中提取要点,自行完成排版设计与文字渲染。

能力对比:四大场景实测表现

以下通过实际案例,直观呈现SenseNova-U1-8B-MoT-Interleaved图文交错增强版模型在各类图文创作任务中的真实表现:

场景一:教程类内容生成

• 任务场景:生成带有步骤说明与配图的图文指南。这类场景的关键痛点在于:步骤必须清晰,图文需严格语义对齐,且画面逻辑要干净实用。 • 原版模型表现:生成的果蔬图像虽较真实,但搅拌步骤的配图出现了违背物理逻辑的“星云漩涡”;且生成步骤较为繁琐,家庭实操实用性偏低。 • 增强版模型优势:西瓜图像更加真实自然,无锯齿状视觉瑕疵(Artifact);搅拌动作完全符合真实物理逻辑;同时步骤精简实用,贴近真实操作场景。

原版

图文交错增强版

场景二:故事书类内容生成

• 任务场景:根据故事文本生成多页连续的儿童绘本,核心难点在于确保角色不“变脸”、情节连贯完整。 • 原版模型表现:未能遵循“角色突然失踪”的关键情节指令;表达形式单一且无文字配解;情节逻辑不够流畅,画面中鸟类尾部及人物面部出现明显形变(Artifact),形象不够卡通,缺乏童话感。 • 增强版模型优势:精准呈现“突然失踪”的核心反转情节;故事原生配有文字讲解,表达形式丰富,可读性大幅提升;角色形象卡通化且稳定,无形变问题。

原版

图文交错增强版

场景三:绘画过程类内容生成

• 任务场景:生成模拟手绘过程的逐步图文内容,要求能循序渐进地呈现绘画步骤与创意作品的诞生全过程,风格需高度统一。 • 原版模型表现:基本遵循指令,但“过程感”呈现有限;画面质感一般,缺乏纸张的纸质肌理,视觉上更接近生硬的数字渲染风格。 • 增强版模型优势:指令遵循更精准;绘画步骤的过程性体现极强,层次感清晰可见;画幅表现异常逼真,纸张上的画面感极强,完美还原了真实手绘的艺术质感。

原版

图文交错增强版

场景四:PPT 内容生成

图文交错增强版模型首次解锁了多页PPT自动生成能力。拿以下“赛博朋克”主题PPT为例:风格高度统一(全程赛博朋克霓虹暗色调)、图文语义严格对应、多页叙事逻辑完整,很好地体现了增强版模型能力。

在单页PPT自动生成上,增强版相比原版也取得了显著提升。

• 任务场景:单页PPT 自动生成,要求内容自动提取、排版设计自动完成,且文字渲染精准准确。 • 原版模型表现:排版布局不够稳定,整体布局欠清晰,文字排布拥挤,美观度仍有较大提升空间。 • 增强版模型优势:不仅在布局稳定性与视觉美观度上实现了质的飞跃,文字排版也更具呼吸感与视觉层次。

原版

图文交错增强版

而且借助"图文交错思维链",模型将 PPT 布局设计的全过程以连续图文的形式逐步呈现,让创作逻辑一目了然。

让长内容创作从此一气呵成

从单张图像的惊艳“盲盒”,到跨越连续多页、逻辑严密、画风如一的“完整图文内容创作”,SenseNova U1图文交错增强版模型的推出,标志着多模态 AI 连续内容创作正式跨入高实用性、高稳定性的全新阶段。

无论是让步骤严丝合缝的图文指南,还是需要角色和情节完美连贯的儿童奇幻绘本,亦或是追求视觉排版层次的商业演示 PPT——它都用强大的指令遵循与极致的视觉质量,给出了令人惊艳的答卷。它让 AI 真正告别了碎片化的单图拼凑,走向了完整、长篇、端到端的连续叙事。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • AI日报:混元发布HyOCR-1.5;PixVerse完成4.39亿美元融资;商汤开源 SenseNova-Vision-7B-MoT

    腾讯发布轻量OCR模型HyOCR-1.5,以1B参数实现推理提速6.37倍并全栈开源。谷歌移动端AI首增聊天记录搜索与文件上传功能。PixVerse完成4.39亿美元C轮融资,估值飙至20亿。苹果iOS 27公测版带来Siri全面AI进化。阶跃星辰公布原生系统Step AOS及首款手机STEPX Neo。小米具身人形机器人工厂实习,双螺母上件成功率98%。商汤开源多任务视觉模型SenseNova-Vision-7B-MoT。QuestMobile 6月报告:豆包月活3.8亿居首,千问增速暴涨近58倍。

  • AI日报:抖音电商将豆包纳入抖店结算序列;Claude Fable5访问权限延长至19日;商汤开源SenseNova-Vision统一视觉大模型

    本期AI日报要点:抖音电商将豆包纳入抖店结算,实现AI导流商业化;Anthropic延长Claude Fable5权限并保持费率,修复品牌形象;商汤开源SenseNova-Vision统一视觉大模型,横跨多任务;Claude Code新增内置浏览器,提升开发效率;努比亚AI宠物机器人iMoochi主打情感陪伴;OpenAI临时取消GPT-5.6使用限制应对需求激增;蚂蚁集团开源两款智能体安全模型;阶跃星辰发布Step Edge终端模型,实现本地多模态处理。

  • HDC 2026|从内容共建到技术开放,花瓣地图文旅生态加速扩展

    华为开发者大会HDC2026上,花瓣地图发布全新AI Agent,以AI技术重塑探索世界的方式。该Agent实现“问问地图”自然对话、语音生成旅行规划及景区伴游解说三大突破,并通过内容分发、服务共生等四大模式构建开放文旅生态。同时,3DGS等技术升级提升了沉浸式体验。通过与《中国国家旅游》及两步路户外助手等伙伴深化合作,花瓣地图正加速数字技术与文旅场景融合,推动深度文化体验。

  • 品牌代言人,正被“内容创作者”替代?

    ​最近,影石Luna Ultra和大疆Pocket4P前后脚上新,社交媒体吵得不可开交,双方更在法律层面开启了互攻。 除了这些明面上的争吵,还有大量网友把争论的焦点引到了合作的内容创作者身上。 更有媒体以“影视飓风们开始‘跳船’”为题,认为这场互攻的标志性事件之一便是Tim、Links率先“变节”。 比如,影视飓风对两款产品的测评,被部分网友认为有所侧重;影石Luna Ultra邀�

  • 浙大系桌面CNC团队获商汤国香、首形科技等近亿元天使轮,要用AI技术降低制造门槛

    桌面级CNC企业「奇塑科技」获近亿元人民币天使轮融资,由商汤国香等共同投资,资金将用于产品研发、量产与营销。继3D打印与激光雕刻后,能进行硬材加工的CNC被视为消费级制造新蓝海。创始人认为CNC是制造业最通用的加工方式,AI重构可降低门槛并下沉至桌面端,释放巨大价值。当前行业核心难点是CAM软件操作复杂、工艺高度依赖经验。奇塑自研AI+CAM系统,将复杂工艺内化,简化操作流程,并通过自建工厂积累数据,迭代算法模型,计划今年Q4推出首款桌面级五轴CNC产品。

  • 京东12.12数藏日新品来袭 《滴水观音》与UOVA潮流盲盒数字资产限量上线

    京东12.12“数藏日”活动开启,发布两款首发数字藏品。大师林建胜的《滴水观音》数字资产,高精度复刻非遗白瓷艺术,定价168元限量6000份;同期推出UOVA潮流数字盲盒,售价9.9元,含品牌权益。活动还预告了京东区块链平台“灵稀”将开启公测,旨在构建一个贯通文化遗产、潮流艺术与前沿科技的数字收藏新生态,并提供从收藏到实体权益的完整体验。

  • 微信“小绿书”会是下一个内容风口吗?

    ​你有没有发现,这一年刷公众号,贴图内容的曝光位无处不在。 服务号信息流里有专门的“贴图”版块,公众号主页有贴图标签页,“看一看”里贴图内容密集推荐,甚至连聊天列表的入口都在给贴图让路。 过去的公众号文章是三五千字打底,配图只是点缀。现在打开消息列表,滑来滑去都是贴图内容,排版像小红书,阅读像刷朋友圈,一眼看完就划走。 今年3月微信把�

  • 别念错了!努比亚NaviX Ultra官方读法公布:奈威 艾克斯

    日前,努比亚正式官宣NaviX Ultra手机,这是全球首款AI智能体手机,将在今日开幕的2026世界人工智能大会上迎来首秀。 对于NaviX”该怎么读,中兴通讯副总裁、努比亚旗舰产品总经理张雷亲自进行了教学,其表示可以读作奈威 艾克斯”。

  • 这届观众,最爱的还是好内容

    ​中国互联网已经进入内容过度饱和的时代。 以视频内容为例,根据《中国网络视听发展研究报告(2025)》,早在一年半以前,国内短视频账号已达16.2亿个,每天产出1.3亿条内容,根本看不过来。 但与此同时,这也是一个优质内容格外稀缺的时代。 打开短视频App,无论怎么刷,映入眼帘的总是“奶头乐”内容,无脑娱乐大行其道。真正值得投入时间和注意力的好内容少之

  • 努比亚NaviX Ultra四色全身照公布:横向跑道Deco 幻梦粉最吸睛

    努比亚正式公布全球首款AI智能体手机NaviX+Ultra,提供蓝境、幻梦、黑、白四款配色,其中粉色幻梦版辨识度最高。该机采用居中单挖孔直屏、四等边设计,侧面配备独立橙色AI键,后置跑道式三摄含潜望长焦。该机是首款搭载备案智能体大模型的终端,内置豆包手机助手,以“听得懂、能干活、记得住、够安全”为目标,支持自然语言指令调用应用。

今日大家都在搜的词: