首页 > 传媒 > 关键词  > 具身智能最新资讯  > 正文

自变量开源 Wall-OSS-0.5,全球领先实现“预训练”比肩“后训练”

2026-05-28 16:34 · 稿源: 站长之家用户

自变量机器人今日正式开源具身基础模型 Wall-OSS-0.5,在全球范围内首次实现了无需针对下游任务进行后训练,预训练后的模型直接部署到机器人上,即可完成搬运、分拣、整理绳索等多种操作任务,在部分任务上的零样本(Zero-shot)泛化表现接近常规微调后的水平。

预训练模型到底能不能直接使用?

过去两年间,VLA(视觉-语言-动作模型)被视为具身基础模型的重要演进方向,然而在实际应用中,一个无法回避的现实是:几乎所有 VLA 都需要在针对特定任务完成后训练后,才能有理想的操作表现。

预训练本身到底有没有让机器人学会直接做事?此前这个问题并没有答案。

Wall-OSS-0.5想要回答的就是这个问题:预训练完,不再做任务微调,直接部署到真实机器人上,能不能干活?

自变量团队在十余个真实机器人任务上做了零样本测试。结果显示,预训练后的模型在分拣、堆叠等结构化操作上达到了可用水平,甚至在从未见过的绳索整理等柔性操作任务上也表现稳定。

Wall-OSS-0.5的关键改进

要让预训练模型产生零样本泛化能力,关键是主干网络本身得真正掌握动作能力,而不是把这件事甩给一个外挂的小模块。但要做到这一点,仅仅"把动作监督接进主干"是不够的,动作以什么形式进入、多路监督能否保持优化方向一致、训练在大规模下能否真的跑得动,每一步都需要专门的设计。下面几项改进,就是沿着这条链路给出的回答。

1. Gradient-bridge:把 scaling law 推进物理世界

当前主流 VLA 训练的范式,本质是一种"分层隔离":先用海量视觉-语言数据预训练 VLM 主干,再在其顶部挂一个动作专家单独训练。这种做法虽然安全,但代价是主干模型本身永远学不会"动作",它只是在为动作专家提供视觉语言特征,并不真正理解物理世界的可操作结构。模型规模再大、视觉语言知识再丰富,也很难翻译成更强的动作能力。

Wall-OSS-0.5的解法是让动作的监督信号直接反传进主干模型。团队把动作离散化为 token,与文本 token 拼接进同一条自回归序列,用交叉熵损失训练。这一支路充当一座gradient-bridge,把"如何动"以与语言完全相同的形式注入主干,让主干在预训练阶段就把"看-说-动"统一在同一套表征里。同时保留 flow matching 损失用于生成连续动作,多模态交叉熵损失作为锚点防止视觉语言能力退化,三路监督共同训练、互不干扰。消融实验显示:去掉"gradient-bridge"这一支,真机任务成功率会出现两位数百分点的下降,且模型规模越大、退化越明显,这正反向证明了让动作监督进入主干、而非隔离在动作专家内部的重要性。

2. 视觉—动作统一表示:让动作 token 拥有语义

但gradient-bridge要真正生效,还有一个隐含前提:主干通过交叉熵学到的东西必须是"动作的含义",而不只是"动作的数值"。如果离散 token 只是对动作做机械的数值压缩,那"gradient-bridge"传过去的就是一串没有物理意义的编号,主干学到的也只是统计共现,与真正的可操作理解相去甚远。

业界广泛使用的 FAST 分词器是基于 DCT 的规则化方案——它能还原动作,但并不知道这个动作"对应画面里发生了什么"。Wall-OSS-0.5训练了一个视觉对齐的残差向量量化分词器:在量化动作的同时,强制 token 表征与对应时刻的视觉特征对齐,并要求其能预测下一帧的视觉变化。这样,每一个动作 token 同时承载"动作的压缩"和"画面如何变化"两层信息——它和视觉、语言进入了同一个语义空间。主干在预测下一个动作 token 时,做的是和"预测下一个词"完全同构的事。仅替换分词器、其他条件不变的对照实验中,真机任务平均成功率大幅跃升,VQA 能力同步提升。

3. 动作空间监督:让优化聚焦于任务最易失败处

Gradient-bridge与视觉对齐分词器解决了主干"学到动作语义"的问题,但模型最终在机器人上执行的是 flow matching 分支输出的连续动作。如果这条分支的训练目标本身存在偏差,再好的语义表征也无法转化成可执行的轨迹。

Flow matching 的标准做法是预测"速度"(噪声到目标的瞬时方向)、损失也定义在速度上。问题在于:机器人轨迹的有效信息分布极不均匀——整体形状(低频结构)决定任务能否完成,高频细节几乎不影响成败。在速度空间训练,模型会把大量学习预算花在拟合无关的高频抖动上,与"梯度桥+视觉对齐"努力建立的语义结构形成内耗。团队把损失从预测速度改写为预测重建出来的动作,效果上等价于对噪声更大的去噪步骤自动加权,让模型把学习重心压回到最关键的轨迹塑形阶段。

4. DMuon:首个面向具身大规模预训练的分布式 Muon 优化器

前三项改进同时在主干上施加了多源监督,带来了一个工程层面的副作用:模型内部参数尺度与梯度强度都高度异构——VLM/video backbone 来自大规模预训练、action head 从头初始化,三路损失反传的梯度量级也系统性失配。这正是 Muon 优化器的用武之地:通过 Newton-Schulz 迭代对更新矩阵做正交化,能有效缓解这类异构带来的优化困难。但 vanilla Muon 单步开销可达 forward+backward 总和的两倍,足以抵消其收敛优势。

团队实现的 DMuon 有两点关键设计:基于 LPT 的 dedicated-ownership 调度(把 all-reduce 替换为 reduce/broadcast,并与下一次 forward 重叠)和利用正交矩阵对称性回收 NS 迭代冗余计算的 CuteDSL kernel,这样就将引入 Muon 的整体开销从2x 降至0.02x,缩减约100倍,以即插即用方式嵌入现有流水线。

与传统的开源VLA相比,真的有效果吗?

在十余个真实机器人任务上的公平对比中(相同数据、相同微调预算),Wall-OSS-0.5在操作类任务和推理类任务上均领先 π0.5等同类开源模型,其中操作类任务的领先幅度尤其明显。更值得一提的是,多模态理解能力没有在动作训练中崩坏——在"具身定位"这种与机器人执行强相关的能力上,模型相比基础 VLM 反而出现了显著提升,印证了协同训练方案的有效性。显示出领先的零样本泛化能力

Wall-OSS-0.5全部开源

具身智能的突破,离不开广大开发者的共同探讨和交流。我们已将Wall-OSS-0.5的模型权重、训练代码、训练配方、消融实验、乃⾄底层优化器完全开放,希望能为研究者和开发者们提供一个具备实际参考价值的全新起点。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 突破具身智能泛化瓶颈!支持20多种机器人构型,蚂蚁灵波开源具身基座模型LingBot-VLA 2.0

    蚂蚁灵波科技于7月8日升级并开源具身基座模型LingBot-VLA2.0。该模型预训练融合了6万小时高质量数据,泛化性显著提升,支持17个品牌20种机器人构型及头、腰、手、底盘等自由度。评测显示,模型在双臂协同和长程移动操作任务中,性能均领先于π0.5等模型。为加速产业落地,模型同步开源高效后训练版本,并与乐聚等伙伴在零售、物流等场景开启商业测试,推动跨构型具身智能生态成形。

  • 10万小时真实数据预训练!小米发布机器人基座模型Xiaomi-Robotics-1

    今日,小米正式发布机器人基座模型Xiaomi-Robotics-1,该模型基于10万小时真实世界操作数据完成预训练,结合跨本体后训练,真正实现具身基座模型的开箱即用”。 在预训练阶段,研发团队使用了10万小时真实世界操作轨迹。 这些数据通过通用操作接口设备Universal Manipulation Interface(UMI)采集,覆盖家庭、商业空间、工业场景、办公室及户外等多种环境,包含大量物体交互和�

  • 在“中华第一商圈”改写“红海”法则:南京新街口万达美华酒店的破局样本

    南京新街口万达美华酒店凭借“定制设计+流量变现+情绪服务”破局同质化竞争。开业前抖音预售破250万,通过预埋打卡点、动态定价,实现假期溢价为竞品1.5倍。其以民国风设计叠加属地文化,用“万人迷”管家与南京地道早餐构建高情绪价值服务,证明差异化创新是红海市场突围的关键。万达酒店及度假村为同程旅行旗下全产业链管理公司,全球项目超280个。

  • 面壁智能端侧模型落地三星盖乐世AI

    三星盖乐世AI等7款手机端AI产品通过国家网信办备案,面壁智能MiniCPM系列作为其端侧模型提供方深度参与。成为唯一以此能力备案的大模型企业。MiniCPM已搭载于吉利、长安等汽车座舱及具身智能等场景,开源模型下载量超3800万次。基于“密度定律”技术路线,推动大模型高效运行于各类终端,此次与三星合作标志进入全球头部手机厂商,加速端侧智能规模化落地。

  • SpaceXAI首个编程智能体模型Grok 4.5发布:与Cursor联合训练 效率翻倍价格减半

    SpaceXAI发布首个编程与智能体专用模型Grok 4.5,由Cursor联合训练,旨在缩小与竞品差距。就在收购Cursor(估值600亿美元)数周后推出。该模型专为处理软件工程等复杂长时任务设计,应用扩展至法律、金融,并强化了网络安全。擅长处理大型代码库,在数万块GB300 GPU上训练。其Token消耗、任务步骤及成本仅为同级模型一半(输入$2/输出$6每百万Token),速度达80 TPS。除代码生成外,还精通Office办公,并能根据简单提示构建应用。现已登陆SpaceXAI控制台、GrokBuild及Cursor,限制重置可免费使用。

  • 灵巧智能亮相WAIC,全栈自研驱动具身智能产业化落地

    2026WAIC开幕,具身智能与灵巧操作再成焦点,行业从“展示能力”转向“交付价值”。灵巧智能携全栈技术体系亮相,直击机器人“能感知难实操”痛点,提出“全栈打通”解法。其构建软硬件协同、数据闭环及多维自研系统,已实现从核心部件到教育、电力、工业等场景的产业化落地,并获头部客户验证。公司聚焦推动技术从实验室走向规模化产业现场。

  • 月之暗面最强模型!Kimi K3发布:全球首个开源3万亿级别模型

    月之暗面发布Kimi迄今最强模型K3,参数达2.8万亿,是全球首个开源3万亿级模型,支持100万Token上下文与原生视觉理解。它面向长程编程、知识工作与复杂推理,擅长长时工程任务、视觉闭环迭代与芯片设计等场景。API已开放,百万Token缓存命中输入仅2元,编程场景缓存命中率超90%,实际输入成本约标价1/4。整体表现虽落后最强闭源模型,但内部评估达前沿水平。

  • 手机新物种!阶跃推出全球首款大模型原生智能体手机

    阶跃终端于7月13日推出全球首款大模型原生智能体手机,搭载智能体原生系统Step+AOS与智能体Amoo,打造模型、软件、硬件“三位一体”的AI新物种。 Step+AOS具备记忆、决策与执行、安全三大能力,采用端云协同架构实现快反应与深思考,通过层级协调机制动态选择模型,并将交互从过程转向结果,支持多模态自然表达,实现意图直达服务。 Amoo能主动学习用户习惯、感知环境,越用越聪明。生态方面已与携程、支付宝、滴滴等达成合作,覆盖出行、政务、生活、办公等全场景服务,构建智能体新体验。

  • 机器人迈向自主进化,百度智能云联合上海交大等机构发布 dVLA-RL

    上海交大、百度智能云与地瓜机器人联合发布dVLA-RL,首次打通离散扩散VLA与PPO强化学习训练,构建预训练-监督微调-强化学习完整技术链。模型在LIBERO等基准上成功率提升至99.7%和92%,推理时延与训练耗时大幅缩短。团队依托百舸平台实现AI Infra优化,推动机器人从模仿走向持续自主学习,加速具身智能产业化。

  • 当大模型公司开始造手机

    喧嚣的国内AI赛道,阶跃星辰一直是相对低调的那一家。可随着智谱、MiniMax首批限售股解禁,月之暗面连拿融资,估值逼近300亿美元,这家自诩“静水深流”的公司,似乎也已按捺不住心中的浪涌。 7月13日,阶跃星辰一口气打出了三张牌:大模型原生AI终端品牌STEPX、智能体原生操作系统Step AOS,以及个人智能体阶跃Amoo。 作为STEPX的首款产品,搭载Step AOS、内置Amoo的全球首款大

今日大家都在搜的词: