具身智能的”高考”成绩:人类100分,最强AI只有12.8分
具身智能的”高考”成绩:人类100分,最强AI只有12.8分
过去一年,VLA、机器人基础模型、世界模型轮番登场。
一个个demo看起来越来越丝滑:叠碗、插管、收纳、倒水、整理桌面,机器人似乎终于开始听懂人话、理解世界、动手干活。
但问题是:这些模型到底谁更强?强在哪里?能不能从仿真走到真实世界?离真正的通用操作机器人,还有多远?
现在,一个新的”登山路线图”来了。
曾推出RoboTwin系列基准的原班团队,又带来了RoboDojo:一个统一的仿真+真实世界机器人操作评测基准。
它不只是又一个benchmark,而更像是给具身智能立了一座”珠峰”:
42个仿真任务,18个真实机器人任务,30个主流机器人策略同台竞技,覆盖泛化、记忆、精细操作、长程执行、开放语义理解五大能力。
结果很直接,也很残酷:
> 当前最强通用机器人策略,在仿真平均成功率也只有8.80%。到了真实世界,最好模型平均成功率也只有12.8%。 > > 而人类专家呢?仿真里是76.03%,真实世界是100%。
机器人基础模型们看起来已经开始攀登具身珠峰,但RoboDojo的榜单显示:它们大多还在山脚适应高反。
先看任务设计:这座山为什么难?
RoboDojo的难点,不在于简单堆任务数量,而在于它把机器人操作能力拆成了一组更接近真实世界的”登山关卡”。
在仿真环境中,RoboDojo设计了42个任务,围绕五个核心能力展开:
Generalization,看模型能不能适应新背景、新光照、新物体和复杂杂乱场景。
Memory,看模型能不能记住之前看到的信息,并在后续动作中用上。
Precision,看模型能不能完成插入、对齐、精确接触等高精度操作。
Long-Horizon,看模型能不能完成多步骤、强依赖、误差会累积的任务。
Open,看模型能不能理解没见过的开放语义指令,并把语言目标变成动作。
这些任务不是简单的pick-and-place变体。
比如在泛化任务中,桌面杂物最多可随机到25个,背景、光照、物体外观和布局都会变化;
在记忆任务中,机器人需要记住传送带上曾经出现又消失的物体,再从后续候选物中选出匹配目标;
在精细操作任务中,机器人要完成插管、对齐、插入等高容错要求动作,稍微偏一点就会失败。
长程任务则更接近真实家务:机器人不是做一个动作,而是要连续完成多个子步骤。拿起、移动、交接、对齐、放置,每一步都可能引入误差,而误差会一路累积到最后。
但RoboDojo没有停在仿真里。
真正让这座”具身珠峰”变高的,是它还把评测搬到了真实机器人上。
RoboDojo设计了18个真实世界任务,覆盖ARX X5、Piper、Piper X三种双臂机器人平台,每个平台各6个任务。
这些任务不是仿真任务的一一复刻,而是专门用来考察机器人在真实物理世界中的部署能力。
比如ARX X5上有盖积木、做面包、制作食物、装水果并倒出、保险箱收纳、插管等任务;Piper上有堆叠并盖住积木、填笔筒、把物体放进篮子、插充电器、叠碗、扶正瓶子等任务;Piper X上则包括物体分类、拆乐高、挂杯子、把物品装进背包、清扫积木、盖笔帽等任务。
这些任务听起来都很日常,但对机器人来说并不简单。
因为真实世界里每一步都带着物理不确定性:物体可能滑动,夹爪可能没夹稳,机械臂可能有微小延迟,相机可能有噪声,接触瞬间可能把目标推偏。
更重要的是,RoboDojo-RealEval对真机评测做了标准化:统一硬件配置、工作空间布局、光照条件、场景复位流程、评测协议和部署接口。
每次测试前,评测人员会根据预设布局复现场景;每个trial还会由三名评审双盲打分,既看最终成功,也看中间步骤完成情况。
也就是说,RoboDojo的真机部分不是”拍几个demo视频”,而是把真实机器人操作变成了一套可复现、可比较、可远程接入的标准化考试。
换句话说,RoboDojo不是只在仿真里问机器人”你会不会做题”,还在真实世界里追问:换一台机器人还稳不稳?真实接触来了会不会抖?物体偏一点还能不能修正?任务做到一半出错会不会恢复?离开仿真训练场,还能不能继续爬山?
这才是”具身珠峰”的真正含义:不是单点能力登顶,而是仿真诊断和真实部署两条路线都不能掉链子。
榜单一出,差距摆上桌面
RoboDojo最核心的部分,是它的公开排行榜。
这也是它和很多”自家模型自家测”的评测不同之处:
RoboDojo由全学术机构联盟发起和维护,背后没有商业模型方利益绑定,榜单治理则由公益性组织AI MMLab Club基金会负责。
换句话说,这座”具身珠峰”不是某家公司给自己修的观景台,而是面向整个社区开放的一条公共登山路线。
在仿真榜单中,团队集成并评测了30个代表性机器人操作策略,包括Hy-Embodied-0.5-VLA、Spatial Forcing、π0.5、X-VLA、GR00T-N1.7、π0、OpenVLA-OFT等。
榜单第一是Hy-Embodied-0.5-VLA,平均分13.07,平均成功率8.80%。
紧随其后的是Spatial Forcing、π0.5、X-VLA等模型,但整体表现依然处在很低区间。
即便是领先模型,在五大能力维度上也没有一个真正”全能”。
有的模型泛化更强,有的精细操作更稳,有的长程任务能多推进几步,但一旦拉到完整榜单上看,短板就非常明显。
RoboDojo的一个关键信息是:今天的机器人模型不是不会动,而是不够稳;不是完全不会做任务,而是很难稳定做完任务。
很多策略可以完成部分步骤,但最终成功率很低。
比如长程任务里,机器人可能已经拿起物体、移动到目标附近,却在最后对齐、插入、放置或恢复阶段失败。
这也是具身智能和纯语言、纯视觉任务最大的不同:在物理世界里,差一点就是失败。
真实世界榜单更扎心
如果说仿真还是”训练场”,真实机器人就是”珠峰实地”。
真实世界榜单里,表现最好的模型是π0.5,总体成功率12.8%,平均分22.9。
头部梯队包括InternVLA-A1、GalaxeaVLA、Xiaomi-Robotics-0、X-VLA等,但整体成功率依然只有个位数到十几个百分点。
这说明一个非常关键的问题:仿真里相对靠前,不代表真实世界里一定稳。
真实机器人会引入额外困难:相机噪声、标定误差、机械臂延迟、接触不稳定、动作抖动、安全边界、物体初始位置微小偏差。这些东西在demo视频里常常看不见,但在标准化评测中会集中暴露。
RoboDojo的意义也在这里:它不是只问”机器人有没有做成功”,而是在问:
> 这个策略能否在仿真中通过全面性考察,同时在现实世界中能够直面挑战?
为什么说这是”具身珠峰”
从结果看,RoboDojo暴露出一个很现实的判断:当前机器人基础模型的能力增长并不均衡。
有些模型可以更好地识别目标,有些模型可以更顺畅地执行动作,有些模型在长程任务中能推进更多步骤。
但真正的通用机器人,不能只在某一个能力维度上强。
它既要看得懂,也要记得住;既要规划对,也要手上准;既要能处理熟悉任务,也要能理解开放指令;既要在仿真里跑通,也要在真实机械臂上稳定执行。
而RoboDojo的实验结果显示,今天的模型在这些维度上仍然存在明显短板。
最典型的是Open任务。即使最强模型,在开放语义任务上的成功率也只有约1.67%。
这意味着,当前机器人基础模型距离真正”听懂人话并可靠干活”还有明显距离。
它们可以在熟悉任务上模仿,但面对新目标、新语义、新组合时,语义理解、视觉定位、技能选择和动作执行这条链路仍然很脆。
这正是具身珠峰的难点:不是单点能力登顶,而是所有能力都不能掉链子。
我的判断:这是起点,不是终点
1. 从”demo驱动”到”标准化评测”
过去,机器人领域常常被demo驱动。
一个模型能完成几个漂亮任务,很容易让人产生”通用机器人快来了”的错觉。
但从RoboDojo可以看出,具身智能正在从”demo驱动”走向”标准化评测”。
这意味着什么?
意味着我们开始能够用同一把尺子,衡量不同模型的真实水平。
这需要两个能力:一是对机器人操作能力的深入理解,二是对评测标准的统一设计。
2. “仿真里强”不等于”真实世界里稳”
RoboDojo的发现说明了一个问题:仿真里相对靠前,不代表真实世界里一定稳。
真实机器人会引入额外困难:相机噪声、标定误差、机械臂延迟、接触不稳定、动作抖动、安全边界、物体初始位置微小偏差。
这些东西在demo视频里常常看不见,但在标准化评测中会集中暴露。
未来的具身智能竞争,将是谁能更好地从仿真走向真实世界,谁就能赢得市场。
3. “差一点就是失败”:物理世界的残酷
RoboDojo的关键信息是:今天的机器人模型不是不会动,而是不够稳;不是完全不会做任务,而是很难稳定做完任务。
写在最后
具身智能的”高考”成绩:人类100分,最强AI只有12.8分。
这不只是一次评测结果的公布。
它标志着具身智能从”demo驱动”走向”标准化评测”,从”仿真里强”走向”真实世界里稳”。
从”单点能力登顶”走向”所有能力都不能掉链子”。
未来的具身智能竞争,将是谁能更好地从仿真走向真实世界,谁能更准确地识别”差一点就是失败”的问题,谁就能赢得市场。
这座”具身珠峰”已经立起来了。接下来,就看谁先登顶了。