首页 > 传媒 > 关键词  > 蚂蚁灵波最新资讯  > 正文

蚂蚁灵波定义视频生成第二赛道,开源LingBot-Video,融合7万小时具身数据

2026-07-09 17:11 · 稿源: 站长之家用户

7月9日,蚂蚁灵波开源 LingBot-Video,这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能的开源视频生成基础模型。该模型围绕机器人和具身智能的核心需求重新设计视频预训练范式,在推理效率、物理合理性、动作理解和任务完成度等方面取得系统性提升,为视频基础模型从数字内容创作走向具身智能提供了新的开源底座。

在北京大学联合字节跳动发布的基准 RBench 上,LingBot-Video 的总分是0.620,超越了 Wan2.6(0.607)、Seedance1.5Pro(0.584)、Cosmos3Super(0.581)。RBench 作为面向机器人操作视频的综合评测基准,重点考察模型能否生成符合真实物理规律的机器人行为。这一结果表明,LingBot-Video 在生成机器人相关视频时,更能保持动作过程的合理性和任务执行的完整性。

(图说:LingBot-Video 在 RBench 上性能最优)

为进一步验证 LingBot-Video 对物理世界变化的建模能力,蚂蚁灵波在内部 benchmark 中从通用质量和具身领域两个维度进行评估。结果显示,对比 NVIDIA Cosmos3、Wan2.2A14B、LongCat-Video、Hunyuan Video1.5、LTX-2.3等五个开源模型,LingBot-Video 在具身领域表现优于主要基线模型。

(图说:综合评测显示,LingBot-Video在具身相关场景中展现出更强的物理理解和动作一致性)

过去几年,视频生成模型在画质、流畅度和创意表达上快速进步,但对于具身智能来说,一个看起来逼真、动作流畅的视频,却无法反映真实的物理规律,难以支撑机器人连续预测、规划和执行任务。与此同时,具身智能还要求模型具备更高推理效率,以适应实时交互和控制闭环。

这也让视频生成开始出现两种不同的演进方向:一条通向影院,服务于内容创作;另一条通向机器人,服务于物理世界的理解、预测与交互。LingBot-Video 正是蚂蚁灵波面向具身智能开辟视频生成新路线的重要探索。

LingBot-Video 从架构、数据和训练三方面进行了系统创新。

在架构上,LingBot-Video 采用 DiT + MoE 设计,以 MoE 替代传统 Dense 架构,在扩大模型容量的同时控制单次推理成本。其30B 总参数模型在生成时仅激活约3B 参数,相比同等参数规模 Dense 架构拥有约3倍推理效率。这一设计使模型既能获得大规模参数带来的视觉表达能力,又更适合具身智能对高效推理的要求。

在数据上,LingBot-Video 构建了数据画像引擎,在海量互联网视频的基础上进一步引入 VLA、VLN、Ego 等机器人相关数据,覆盖灵巧操作、机器人移动和第一视角交互等场景,总规模达7万小时的具身数据。这些数据帮助模型学习动作与环境变化之间的关系,而不只是学习视频的表面纹理和视觉风格。

在训练上,LingBot-Video 引入多维强化学习奖励系统。除美学、prompt 跟随和运动一致性等常规指标外,模型进一步围绕物理合理性和任务完成度进行对齐,使生成结果更符合真实世界规律,也更贴近机器人在真实世界完成任务的需求。

据介绍,LingBot-Video 可用于机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等方向。目前,LingBot-Video 已正式开源。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 京东开源JoyAI-Video-Edit模型!实现视频边播边改:综合性能全球领先

    京东正式开源自研实时流式视频编辑模型JoyAI-Video-Edit,打破传统视频先成片再剪辑的固有模式,实现播放画面同步实时修改,在流式实时视频编辑方向的各项指标全面领先,达到世界一流水平。 依托JoyAI基础大模型底座,设备在720P分辨率下可稳定实现30帧实时运算,画面处理无明显延迟卡顿,适配常规视频播放同步修改需求。模型摒弃行业只能剪辑短视频片段的短板,支持超

  • 云蝶科技与大湾区大学共建具身智能与空间智能联合实验室,打造具身智能空间底座

    云蝶科技与大湾区大学共建具身智能与空间智能联合实验室,由王广聪博导领衔顶尖团队。合作以“懂算法”与“懂场景”双向奔赴,跳出标准答案,聚焦开放动态非标环境下的空间认知、状态建模与自主决策,围绕酒店、物业、医疗、能源等真实场景,攻关多源空间数据采集、统一表示、场景资产、世界模型与仿真评测,构建Real2Sim2Real闭环,沉淀可复用规范与资产,降低重复成本,推动空间智能基础设施向工程能力演进,助力具身智能规模化落地。

  • MiniMax H3视频模型正式开源:全模态理解输入,最高生成2K 视频

    MiniMax 今日正式开源新一代通用视频模型 MiniMax H3,这款模型被定位为通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高2K 分辨率、最长15秒、带原生立体声音频的视频内容。 得益于以任务泛化为导向的系统设计,H3在预训练阶段便具备了广泛的多模态上下文理解与生成能力,官方称其能够出色地遵循复杂的多模态指令。输出规�

  • 具身智能最大的幻觉,是先把人拿掉

    具身智能正从单点Demo走向持续运行的生产系统。行业关注点从“能否完成动作”转向数据如何生产、模型如何迭代、失败如何回流。动作数据被当作工业品,分为预训练、后训练与运营回流三段。模型层面,世界模型、分层实时架构正在成为主流方向,以平衡高层认知与底层高频控制。商业化上,企业普遍接受“部分自主+人类接管”的渐进路线,家庭场景面临更高安全要求。云基础设施从租用GPU深入到共建数据与训练流程,一条由数据、模型和运营反馈构成的隐形生产线,正决定机器人能在现实世界走多远。

  • 智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5

    智谱创始人几个小时前才说GLM-5.3很快发布,没想到中午就发了,相比当前的GLM-5.2提升50%,是开源最强的,编程与智能体性能接近Fable 5。 与之前传闻的不同,GLM-5.3跟GLM-5.2基座模型还是一样的7400多亿参数量,升级到万亿参数是没有的,有可能是留给GLM-5.5了,但这也没有妨碍GLM-5.3通过后训练来提升性能水平。 根据智谱说法,在多项主流基准测试中GLM-5.3是当前排名最高的开源�

  • 智谱发布 GLM-5.3,自称编程最强的开源模型

    智谱在8月14日正式推出 GLM-5.3。有意思的是,这一版的基座模型跟 GLM-5.2其实是同一个,提升全靠后训练 Scaling 把智能上限往上拉,用了几十倍的长程任务环境、更丰富的环境类型,还有超长的后训练时间。 编程是这次最被拿来当卖点的能力。智谱称 GLM-5.3是编程能力最强的开源模型,内部体感评测比上代提升50%,在 Terminal Bench3.0、Agents' Last Exam(CLI)这些公开基准上拿到开

  • 昆仑之数亮相2026具身智能大会:用“数据石油”炼就人形机器人“进化燃料”

    2026年8月12-14日,第四届中国具身智能机器人产业大会在沪召开,聚焦商业化。昆侖之数创始人黄万忠提出:人形机器人下半场胜负不在关节,在灵魂,灵魂由数据铸就;发布“昆侖金字塔”五阶段路径及Coludata RVR数据训练平台,提升数据效率与泛化。展区机器人泡茶、机器狗引关注。公司坚持“Robot for Process”,以数据飞轮推动从卖硬件到运营智能资产。

  • 渝见开源,数智启新|2026 CCF中国开源大会盛大启幕

    2026 CCF中国开源大会在重庆开幕,以“渝见开源,数智启新”为主题,聚焦AI与软件工程双向赋能。多位院士指出AI提效但无法取代工程化思维;大会发布泛在操作系统社区成果及ODTC开源激励计划,设多场分论坛覆盖芯片、操作系统、具身智能等,共建开源生态推动数字产业升级。

  • 10万小时训练!小米具身基座模型Xiaomi-Robotics-1正式开源

    今日,小米技术宣布,小米具身基座模型 Xiaomi-Robotics-1正式开源。 据介绍,Xiaomi-Robotics-1基于超过10万小时UMI数据进行预训练,并使用超过1万小时跨本体数据进行后训练。

  • 腾讯云联合沙利文发布《2026年全球具身智能技术创新与应用白皮书》丨 谁来铸造具身智能的下一代AI数字基座?

    具身智能产业化竞争焦点正从机器人“身体”转向“大脑”,即具身基础模型。产业呈现“实体+数字”双层结构,价值重心向数据闭环和模型迭代迁移。全球市场即将爆发,中国预计2030年占据37%份额,形成“硬件创新+场景落地”的差异化优势。行业面临异构算力、模型开发碎片化、复杂场景部署三大挑战。以腾讯云为代表的全栈AI数字基座,正通过云基础设施、开放平台和工具链,加速技术验证走向规模化商业落地,决定未来产业生态格局。

今日大家都在搜的词: