具身智能的算力焦虑被放错地方了:99%数据缺失的”数据荒”才是真正的隐形杀手

具身智能的算力焦虑被放错地方了:99%数据缺失的”数据荒”才是真正的隐形杀手

整个行业都在围绕GPU喊紧,H100被炒到四万美元、交期拉到数月,算力成了AI行业最大的显性焦虑。但如果你把眼光从云端的大模型往下移到机器人本体,一个更致命的问题其实早已埋伏在那里——数据荒。

根据行业测算,训练出具备通用泛化能力的具身模型,需要千万甚至亿小时级别的真实物理交互数据。而截至2026年初,全球可用的高质量数据总量仅约50万小时,缺口超过99%。这不是渐进差距,是断档。算力贵是暂时的,数据缺是结构性的。

算力是产能问题,数据是维度灾难

台积电CoWoS的月产能从2023年的1.4万片提升到2025年的~7万片,预计2026年底达到13万片。英伟达每代GPU单位算力成本都在下降。摩尔定律虽然放缓,但算力扩张的路径清晰可见——投钱、扩产、等时间,总有缓解的一天。

数据端完全没有这种好事。大语言模型能卷走互联网积累的千年文本,45TB起步。但机器人面对的物理世界,根本没有一本现成的”教科书”。你让AI学会”拧瓶盖”,它需要理解材质、螺纹摩擦力、扭矩反馈——这些变量从不出现在互联网语料里。拧瓶盖这个人类凭直觉就能做的动作,背后是物理世界的无限复杂维度。

仿真似乎是一条近路。Stanford《2026 AI Index Report》显示,仿真任务完成率可到89.4%,但真实家庭场景骤降到12.4%。虚的再精致,也只是”仿”——任何缺口都会在物理世界的真实摩擦里被撕成口子。而且别以为从A机器人训练的数据能直接喂给B机器人,身高差20cm的数据在关节角度、重心偏移、抓握角度上全部不同。数据之间天然隔离,形成一个个孤岛。

更糟的是质量。

大模型训练里有错别字还能处理一万遍的正确样本压过去,但具身智能对噪声极敏感。摄像头帧率抖动、传感器延迟、力控偏移,这些不是”修正”就能解决的,因为它们会污染整个动作模型。鹿明机器人联席CTO丁琰说过一句很实在的话:大量UMI设备采集出来的数据根本进不了训练管线。不是费力,而是没劲。低质数据不仅帮忙,还坏模型。

三条采集路线,每条都卡在三角悖论

第一,真机遥操作。宇树用G1-D在5000平米场地摆了120台机器人,智元部署约200台,带着几百人轮班做遥操。这条路数据成色最好,但花多少钱?场地带设备数千万,人员工资是持续开销。以机器人厂商的资金状态,靠这条路线铺到亿级数据——几乎不可能。

第二,UMI无本体采集。人手持轻量摄像头和夹爪在日常场景中操作。采集门槛低了、速度快了。问题是,摄像头角度不一致导致数据格式混乱,高质量数据和大规模采集之间非但不是跷跷板——两头都不着。交大卢策吾团队指出,数据多了,质量降了,后续人工后处理的成本反而让综合代价不降反升。这条路埋雷在隐秘处。

第三,仿真合成。跨维智能100%用合成数据训练VLA模型后成功移栽真实机器人,诺基亚联合英伟达把训练速度提了10倍,表面看很有突破。但89.4%到12.4%的落差就摆在那里。不是一个模型不行,而是所有仿真模型都面临同样的物理鸿沟。

精度、规模、成本,目前每条路线最多拿到两个。短期内并行探索可以维持,但距离”数据奇点”还差得很远。

囚徒困境:数据该不该开源

理论上最理性的解法是——行业共享,避免重复采集,摊薄成本。乐聚牵头宇树、阿里云建了OpenLET,开源超6万分钟真实数据;均普智能也放出了面向RL的数据集RW-RL-Dataset;京东搞了个数据交易平台,首批2000小时高精数据上线卖。

但更多公司在干什么?在继续囤数据。箸境智能完成了全国首笔数据集交易,鹿明机器人打造了”数据超市”,星海图CEO高继扬直言:数据具有强烈的”私有化属性”

谁先开源,谁就可能被对手低成本复制成果。经济学教过的东西,放到AI产业里照样生效:集体最劣、个体最优的时间循环。除非出现强有力的行业标准与利益分配机制,否则开放只是少数派的理想主义,大多数玩家首要的选择是把数据当作核心资产和交易品。

时间越往后拖,重复采集的浪费越大,孤岛之间的壁垒越深。

出路不在数量,而在飞轮

与其等全行业的数据源汇聚,更务实的方向可能是:让机器人自己跑起来,产生、过滤、传递自己的数据。大模型已经走通了这条路——英伟达Eureka系统对机器人任务的自我批评和改进率超过人类专家,53%的任务里获得52%性能提升。Kimi K2用工具模拟器在沙盒中让智能体反复练习。

核心逻辑都一样:不再被动等待人类投喂,而是通过与环境互动自主生成训练信号。

上海创智学院与智元提出的LWD系统就是一个现实案例。机器人在真实任务中持续回传成功轨迹、试错恢复体验、人工引导的失败案例,单一通用策略的平均成功率从传统行为克隆的0.76提升到0.95。

这意味着每一个机器人遇到的意外,都可以变成整个机器人群的共同经验。A机器人在真实场景中遇到滑丝瓶盖并微调成功后,这个方法被记录、上传、更新——所有机器人都学会了纠正。当这个闭环跑起来,机器人才真正脱离”数据喂养”阶段,进入”自我进化”阶段。

届时的瓶颈不再是数据总量,而是闭环的精度、信号的质量、迁移的泛化。

写在最后

算力有钱就能买,物理世界的经验必须亲自积累。谁能让机器人跑通”采集→训练→落地→再采集”的自我迭代飞轮,谁就定义下一个阶段的行业格局。这从来不是一场GPU军备竞赛,而是谁能帮机器人”理解”物理世界的长跑。中国在这一方向已经有了布局和尝试,真正的分水岭不是谁的机器人更多,谁先进入自我进化的循环。毕竟,这是一场比积累、比闭环、比迭代的马拉松,而不是比谁囤的显卡更多。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注