首页 > AI头条  > 正文

8B 参数塞进 4K 生成与编辑,商汤开源轻量统一多模态模型 U1.5-Lite 预览版

2026-08-04 16:21 · 来源: AIbase基地

商汤科技宣布面向社区开源轻量级统一多模态模型 SenseNova U1.5-Lite-Preview。这款模型并非简单的规模升级,而是基于 SenseNova U1 的系统性迭代,在同一架构中贯通视觉理解、推理、生成与编辑四大能力。

最引人注目的是其轻量体量——仅以 8B-MoE 的参数规模,就将能力推进到 4K 分辨率、更精细的真实质感以及更复杂的视觉控制。商汤表示,如果说 U1 验证了统一架构的可行性,那么 U1.5 要进一步证明能力能否持续扩展。

image.png

四大方向显著提升,生成与编辑全链路优化

相比 U1,U1.5-Lite-Preview 在四个核心方向带来显著提升:原生支持 4K 图像生成、更精细的局部纹理与真实世界质感、更准确的中英文文字生成与复杂版式组织、更稳定的图像编辑和视觉指令遵循。

在技术细节上,商汤针对网格伪影和高分辨率细节建模问题,重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练扩展至 4K 分辨率。在图像编辑方面,模型重新组织了编辑数据与训练任务,强化对原图内容、主体身份、空间结构和非编辑区域的保持能力,确保在完成目标修改的同时尽可能保留原图中不需改动的部分。

多项基准测试大幅提升,编辑能力尤为突出

测评结果印证了这轮优化的实际效果。Qwen-Image-Bench 得分从 47.14 提升至 55.20(配合提示词增强),ImgEdit-Bench 从 3.90 升至 4.37,GEdit-Bench 英文版从 7.47 提升到 8.17,中文版从 7.42 升至 8.05。整体来看,生成质量与编辑稳定性均有明显跃升,尤其在图像编辑的指令遵循与原图保持方面进步突出。

商汤强调,U1.5-Lite-Preview 的核心思路是不盲目扩大模型规模,而是对生成与编辑全链路进行系统性优化。这种"以架构创新换取能力增长"的路线,为轻量级多模态模型的持续迭代提供了一个值得关注的范本——当 8B 参数就能跑通 4K 生成与精细编辑,统一多模态架构的潜力或许才刚刚开始释放。


  • 相关推荐
  • 云蝶科技科研团队最新成果在机器学习全球顶会ICML 2026发表,POLIA让多模态模型从“答对”走向“看对”

    云蝶科技在ICML2026提出POLIA方法,解决多模态大模型常忽视关键视觉信息、依赖语言猜答案的问题。核心创新是增加视觉对象级细粒度评价,分阶段评估答案正确性与证据可靠性,实现从“奖励正确答案”到“奖励正确使用视觉证据”的转变。在七项基准测试中大幅提升准确率,且计算开销低。该研究为具身智能的视觉证据建模与强化学习提供基础,依托联合实验室推动从算法验证走向真实场景应用。

  • AI日报:商汤甩出8B小钢炮 U1.5-Lite-Preview;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光

    微软推出支持16语言的全双工语音模型MAI Realtime;MiniMax开源视频模型H3但限制部分地区使用;商汤发布轻量统一多模态模型U1.5-Lite-Preview;面壁智能开源ForgeStencil实现工业软件自动化优化;Teams新增“举报会议”功能防AI诈骗;ChatGPT Atlas浏览器将停服;苹果诉OpenAI案曝内部数据管理漏洞;高德升级世界模型ABot-World-0,实现24小时连续稳定推理。

  • 天下苦闭源模型久矣,MiniMax H3要做多模态领域的Deepseek

    2026年8月3日,港股MINIMAX-W(00100.HK)报HK$249.4,涨幅超10%。当日早盘,MiniMax盘前正式宣布发布新一代多模态生成模型H3。市场用真金白银为这次产品发布投了一票。 A 天下苦闭源模型久矣,视频生成赛道此前由Seedance、可灵等头部模型主导,价格、算力、生成时间也一直是行业关注比较高的的话题。 MiniMax发布的H3,正是视频生成市场的一个全新选择。 官方博客中表示,定位H3

  • MiniMax H3视频模型正式开源:全模态理解输入,最高生成2K 视频

    MiniMax 今日正式开源新一代通用视频模型 MiniMax H3,这款模型被定位为通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高2K 分辨率、最长15秒、带原生立体声音频的视频内容。 得益于以任务泛化为导向的系统设计,H3在预训练阶段便具备了广泛的多模态上下文理解与生成能力,官方称其能够出色地遵循复杂的多模态指令。输出规�

  • 全球参数最大开源模型 马斯克也点赞!月之暗面Kimi K3开源 2.8万亿参数

    日前,月之暗面正式发布Kimi K3模型权重及技术报告,并同步开源支撑该模型训练的三项关键基础设施技术:MoonEP、FlashKDA和AgentEnv。 据介绍,三项技术在Kimi K3的训练过程中发挥了重要作用,为大规模模型训练的效率、稳定性以及智能体任务执行提供基础支撑。 据了解,Kimi K3是月之暗面目前能力最强的模型,该模型采用混合专家(MoE)架构,总参数规模达到2.8万亿,具备原生

  • AI日报:京东开源视频实时编辑模型;Qwen-Image-3.0上线;腾讯混元发布Hy ASR 3.0 preview

    本期AI日报聚焦八大突破:京东开源实时视频编辑模型;阿里千问图像生成开放API;腾讯混元语音识别读懂语境;字节全双工SeedRealtime上车豆包;马斯克Grok 4.6将灌入SpaceX数据;影石硬件联手千问推出语音助手;Mistral开源3B多模态审核模型Shieldstral;宇树科技机器人冲刺科创板IPO。

  • 全球最大2.8万亿参数大模型 Kimi K3今晚正式开源:性能坐稳前三

    国产大模型公司月之暗面本月16日发布新一代旗舰大模型Kimi K3,官方表示会在7月27日正式开源,今晚就要登台了。 Kimi在Hugging Face官方账号创建了Kimi K3模型页面,并开启权重发布倒计时,页面显示该模型预计将在北京时间7月27月23时上线,也就是今晚11点。 这个时间点也比较适合美国当地时间,显然是想给刚上班的美国人一点震撼。

  • 虎牙WAIC 2026首发实时多模态数字人VAM 1.0

    虎牙在WAIC论坛发布实时多模态数字人模型VAM1.0。董事长林松涛指出,真实场景是AI价值第一现场,AI普惠在于让普通人变强。CEO黄俊洪强调,该模型基于一张照片即可实时生成能听、能说、能交互的虚拟人,通过三段式训练解决崩坏、自然度与成本问题。VAM瞄准直播互动痛点,将推动虎牙从“看别人玩”向“和AI一起玩”跨越,开启指数级增长。

  • 车机自动化测试降本增效实践:多模态交互与兼容性测试行业方案

    软件定义汽车趋势下,智能座舱高频OTA与多模态交互使传统人工测试面临场景覆盖不足、性能评估主观、兼容周期长等瓶颈。行业聚焦四大核心:车机性能测试以自动化采集量化指标;多模态交互仿真补齐全场景盲区;蓝牙/CarPlay兼容测试依托分布式真机池破解海量设备适配;选型强调一体化测试、无码脚本复用及私有化集成。标准化智能工具替代重复人工,实现效率与缺陷检出精度双向提升,从研发源头保障座舱品质。

  • 京东开源JoyAI-Video-Edit模型!实现视频边播边改:综合性能全球领先

    京东正式开源自研实时流式视频编辑模型JoyAI-Video-Edit,打破传统视频先成片再剪辑的固有模式,实现播放画面同步实时修改,在流式实时视频编辑方向的各项指标全面领先,达到世界一流水平。 依托JoyAI基础大模型底座,设备在720P分辨率下可稳定实现30帧实时运算,画面处理无明显延迟卡顿,适配常规视频播放同步修改需求。模型摒弃行业只能剪辑短视频片段的短板,支持超

今日大家都在搜的词: