首页 > 业界 > 关键词  > 具身智能最新资讯  > 正文

人均,具身智能榜单能信吗?

2026-07-21 13:55 · 稿源: 定焦one公众号

声明:本文来自于微信公众号 定焦One,作者:王璐,授权站长之家转载发布。

具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。当“第一”几乎成为各家标配时,榜单还有可信度吗?

一个多月前,千寻智能就经历了尴尬时刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜单上以1918分的成绩超过了英伟达Cosmos3的1880分,一度位居“世界第一”;紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计完成四轮密集融资,总额接近50亿元,创下具身智能赛道的融资频率新高。

不过,业内对评测数据的质疑几乎从次日就开始升温。有观察者指出,在310次评测记录中,有72%的分数来自两个账号。更值得关注的是,RoboArena官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。Spirit v1.6也随之从榜单上除名。

但这一事件并未浇灭玩家们的热情,翻开近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都攥着一个“第一”,且这些“第一”维度各不相同。

这一景象或许不难理解,具身智能目前技术路线还没统一、真机成功率大多卡在五六成,外界想判断一家公司到底行不行,很大程度上只能依赖榜单。可当发榜的既有高校、机构也有媒体,各家标准各不相同、有的还牵扯商单和利益关系时,榜单本身还能不能当尺子用,就成了一个问题。

一位关注具身赛道的投资人坦言,榜单更偏市场行为,最多算投资决策的一个参考,他对于千寻这件事并不吃惊。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个“第一”,可能正是他们“写在报告里一个比较好的入口”。但也有投资人持不同看法,他们认为在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。

当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得看?

01.技术路线还没统一,先人手一个“第一

我们先来盘一盘目前市面上的榜单,建立一个大致印象。据不完全统计,目前具身智能的活跃榜单高达20余个。按评测内容,这些榜单大致可以分成三类。

图片

VLA操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是RoboChallenge Table30、MolmoSpaces;

世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是World Arena和WorldModelBench;

专项基准榜,考察“极端情况下会不会露馅”,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是RoboTwin2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。

需要说明的是,这三类榜单各有侧重、互不替代。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。

有了这层坐标,近半年具身基座模型的战报就能对号入座。如果把近两个月具身基座模型的战报汇总,可以得到一份相当壮观的名单。

今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。进入6月,千寻Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登顶MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。

而乱象,也是从各种榜单开始的。

最明显的是,榜首像流水席,第一名”更换频繁

RoboChallenge Table30的榜首,过去半年里至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、美国波士顿动力Atlas、星动纪元Era0先后超越。

这个速度,比大语言模型的主流榜单更新快得多。2023年到2025年,GPT-4、Claude3、Gemini1.5在MMLU、GSM8K等榜单上的榜首位置,通常能守数月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月为换榜周期。“当下的具身智能,单个模型能霸榜一周就算不容易。”一家头部具身智能公司的从业者米范表示。

其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而MMLU这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。二是测试任务的公开程度,像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的“保质期”于是被压到了以周计。

更让人迷惑的,是同一个榜里会同时冒出好几个“第一”。

World Arena就是典型,智元GE-Sim2.0、跨维DSCFuncWorld对外都称自己“登顶World Arena”,但事实是,这个榜单含有多条赛道,智元GE-Sim2.0在Track1(感知与动作响应)以68.26分排第一,跨维DSCFuncWorld在Track2(数据引擎)排第一。“第一”分属不同个子榜,对外却被统一写成了同一句话。

对不熟悉赛道划分的读者来说,两家并列的“World Arena第一”的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

还有一层更模糊的地带是,榜单性质混杂,“第一”的含金量却被默认成同一档,容易产生误导。

一些公司的对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒体的测评中也位居第一”。前者是7×24小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。

其中最模糊的是“产业榜”,有些榜单顶着“产业”二字,但既不是真机锁死的硬榜,也不是学术机构背书的benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层,“双料第一”才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。

三种现象叠加,结果就是榜单“第一”严重通货膨胀。而且这种通胀不只停留在营销层面,一个“第一”的头衔往往能换来关注度、资源和实打实的估值溢价。

02.一个“第一”是怎么造出来的?

既然榜单能撬动真金白银,如何把第一造出来,也形成了“潜规则”。业内人士介绍,虽然千寻Spirit v1.6属于极端个例,但行业里造“第一”的现象并不少,手法大致有三种。

成本最低、也最普遍的一种方式是话术包装,“单科第一”成了“总分第一核心是省掉关键限定词。

比如实际拿的是“RoboTwin2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假、成绩也是真的,但“第一”所指代的范围被人为放大了。

第二种方式利用“刷题”等方式直接干预结果。

一条是“照着考题练”。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复“刷题”、过拟合到特定场景换来高分。

米范表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和LLM领域的“数据泄露、数据污染”有本质区别。

另一条是钻评测机制的漏洞。有些榜权威性很高,机制却有空子可钻。比如RoboArena采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子。

一是评测者身份无门槛。任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的Elo分数快速推高;

二是匹配不强制全覆盖,随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A 是固定的,B 是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上。比如Spiritv1.6早期与DreamZero交手,23场后停战,与5月30日入榜的英伟达Cosmos3-Nano-Policy为零对战;

三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。比如Spirit v1.6的310次评测记录中,72%的分数来自于ECUST和Robotics Lab两个账号,它们用224场评测刷出97%胜率,把Spirit v1.6推上第一,但英伟达用同样条件自测21次,胜率0%,两组数据摆在一起,直接让从业者产生怀疑。

事后,RoboArena补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于20%的账号标为可疑,堵住选择性匹配。而处理后,千寻跌出榜单。

还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。

不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份“权威报告”,把媒体榜和学术benchmark并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。

这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,“第一”就成了。

这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要一定的技术功底,技术越复杂,外行越难分辨,故事就越容易讲。

03.去掉水分,还该信什么?

不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。

更深一层的问题是,这个行业目前还没有一把“通用的尺子”。

具身智能从业者gashero用“炒鸡蛋”和“拌凉菜”打了一个比方:机器人A擅长炒鸡蛋、成功率90%,机器人B擅长拌凉菜、成功率85%,但不能就此说A比B强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把“炒鸡蛋的能力”和“拌凉菜的能力”折算进同一个打分体系里。

不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。

图片

图源 /RoboChallenge官网

综合业内共识,真正可信的榜单,大体同时具备三个特征。

一是分项透明,不是只甩一个“第一”。

不论综合榜还是专项榜,可信的做法都是把细项一一拆开。以RoboChallenge Table30为例,它测的是30项日常任务的综合成功率,可信之处在于,不仅告诉读者64.33%这个综合数字,还让读者看到30项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。

二是评测由第三方掌控,且有反刷题设计。

MolmoSpaces不允许微调,模型直接“裸考”;LIBERO-Plus则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。

三是看评测机制,而不是看更新频率。

更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。有些榜更新慢,可能因为真机评测成本极高,比如RoboChallenge一次完整评测周期可能要数周,30项任务每项跑10次,一共300次真机尝试,7×24小时连续运行,这是物理世界的成本约束。而有些榜更新快,则是机制设计。比如RoboArena采用了Elo评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。

但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?

答案在于行业当下的阶段。

眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。

当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候,“第一”的通货膨胀会自然消散,榜单也会退回它本该在的位置。

或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。

举报

  • 相关推荐
  • 具身智能最大的幻觉,是先把人拿掉

    具身智能正从单点Demo走向持续运行的生产系统。行业关注点从“能否完成动作”转向数据如何生产、模型如何迭代、失败如何回流。动作数据被当作工业品,分为预训练、后训练与运营回流三段。模型层面,世界模型、分层实时架构正在成为主流方向,以平衡高层认知与底层高频控制。商业化上,企业普遍接受“部分自主+人类接管”的渐进路线,家庭场景面临更高安全要求。云基础设施从租用GPU深入到共建数据与训练流程,一条由数据、模型和运营反馈构成的隐形生产线,正决定机器人能在现实世界走多远。

  • 腾讯云联合沙利文发布《2026年全球具身智能技术创新与应用白皮书》丨 谁来铸造具身智能的下一代AI数字基座?

    具身智能产业化竞争焦点正从机器人“身体”转向“大脑”,即具身基础模型。产业呈现“实体+数字”双层结构,价值重心向数据闭环和模型迭代迁移。全球市场即将爆发,中国预计2030年占据37%份额,形成“硬件创新+场景落地”的差异化优势。行业面临异构算力、模型开发碎片化、复杂场景部署三大挑战。以腾讯云为代表的全栈AI数字基座,正通过云基础设施、开放平台和工具链,加速技术验证走向规模化商业落地,决定未来产业生态格局。

  • 《全球具身智能技术创新与应用白皮书》全球首发

    腾讯云联合弗若斯特沙利文发布《全球具身智能技术创新与应用白皮书》,首呈具身智能全栈数据解决方案。方案以对象存储COS为底座,融合GooseFS加速、数据万象处理、智能视计算等,构建一站式数据平台,打通从采集到训练的数据闭环,实现EB级存储、训练加速与成本优化。七大标杆案例验证其在存算一体、海量数据管理等场景的落地价值。

  • 宿舍手搓双足机器人!22岁哈工大本科生拿下5亿元融资

    近日,全栈开源人形机器人公司RoboParty(萝博派对)宣布,完成近5亿元天使轮及Pre-A轮融资。 成立仅一年半,RoboParty已完成6轮融资,其中天使轮由顺为资本经纬创投、小米战投等押注,Pre-A轮由宁德时代独家投资。 值得注意的是,RoboParty的创始人黄一如今才22岁,在当下这轮人形机器人与

  • 具身智能迎年度检阅:训练可用数据量大增,算力需求涌上云平台

    WAIC上具身智能机器人迎来年度检阅,显著变化是算力需求随数据处理需求暴增而快速涌向云端。腾讯云数据显示,数据清洗与采集需求推动算力增长四五倍。行业大规模转向低成本、高效的“人类数据”(由人穿戴设备采集),其浓度明显上升,甚至能以80%人类数据搭配20%真机数据进行训练。尽管数据总量增长,但特定场景的真机数据依然稀缺,且软硬件强耦合,导致机器人能力演进需逐步迭代,预计数据飞轮将在2至3年内启动。

  • 聚焦技术突破与产业落地 人工智能与机器人两展四大奖项启动申报

    新一轮科技革命推进AI与机器人产业步入应用与产品化新阶段。第28届深圳高交会将设AI与机器人双馆,同步启动四大奖项评选,构建从底层技术突破到场景落地的完整评价链。评选旨在识别能转化为现实生产力的创新,重点考察原创性、工程化、市场验证与场景成效,推动产业从“展示创新”走向“兑现价值”。依托上届展会超45万人次、1700多亿元签约成果的国家平台,获奖者将获对接市场与资本支持,中国机器人产业正迈入“生态竞争”新阶段。

  • 具身智能“200亿俱乐部”:8家公司、吸金千亿,豪赌一个未来

    机器人还没真正学会干活,机器人公司的估值已经先冲上了200亿。 截至2026年6月,国内已有8家具身智能公司估值达到200亿元,被业界称为“200亿俱乐部”,包括宇树科技(以下简称宇树)、智元机器人(以下简称智元)、银河通用、星海图、千寻智能、自变量机器人(以下简称自变量)、智平方、灵心巧手。 其中,智元未在一级市场官宣新一轮融资,但它于2026年3月成为国内首个�

  • 融资+战略双轮驱动:稳石机器人获A+轮融资,AI智慧仓储再提速

    稳石机器人完成A+轮融资,锦富资本领投,2022年至今连获三轮机构加持。公司坚持软硬件全栈自研,以自研Swarm Brain集群AI、多模态感知与动态决策为核心,覆盖AMR、无人叉车、四向穿梭车等全品类,服务宝洁、苹果等百余家头部企业,复购率超80%。本轮资金将加速具身智能大模型场景落地、重载四向车立体库迭代及全球化交付网络建设,从AMR设备商转型AI智慧仓储全案赋能商。

  • 雷军晒小米机器人工作视频:白机器人埋头干活 黑色督工机器人对镜头比耶

    昨日晚间,小米创办人、董事长兼 CEO雷军在微博分享了一条来自机器人团队的视频,并配文:挺有趣的。” 视频开篇,一台白色人形机器人在产线工位上有条不紊地工作,它依靠高精度视觉识别与灵活机械臂,精准完成便携收纳盒折叠工序,整套动作流畅稳定,完成后顺势将成品推至一旁,全程专注投入,如同熟练上岗的车间操作工。

  • 超越英伟达、MIT!卓世科技登顶 MolmoSpaces 全球榜首,斩获具身智能全新SOTA

    卓世科技自研ZoeInside-VLA模型登顶MolmoSpaces全任务榜首,斩获全球SOTA。该模型跳出拼参数的内卷赛道,以4B轻量化架构聚焦VLA真实场景两大难题:训练数据过于理想、缺乏执行反馈。通过引入含纠偏与恢复过程的操作数据,并新增实时执行反馈模块,让模型学会应对真实环境。ZoeInside-VLA是卓世“启元”具身通用大脑直觉系统的核心,搭配逻辑、共情三核架构,将实验室算法转化为工业、康养等可落地方案。

今日大家都在搜的词: