李飞飞把两小时的扫街压到了三张照片:别再说机器人缺芯片了,它缺的是对世界的理解

李飞飞把两小时的扫街压到了三张照片:别再说机器人缺芯片了,它缺的是对世界的理解

过去几年,每次提到”机器人为什么还没大规模落地”,各路专家的标准答案几乎一模一样——芯片不够强、算力不够猛、大模型还没推理出”下一步该动哪只手”。

但World Labs新发布的Atlas,以及李飞飞和a16z合伙人Martin Casado的最新对谈,直接把这条叙事摁住了。

李飞飞的态度极其明确:“未来某天可能会是芯片,但现在绝对是数据。”

不是算力不够,是物理世界的交互数据极度匮乏。不是GPU买不起,是你的人形机器人根本不知道”现实世界长什么样”。

而World Labs刚刚交出的Atlas模型,正在把这个”数据饥荒”从根源上瓦解掉。核心原语只有一个——新视角预测(New View Prediction)。但这个基础原语带来的冲击波,可能会彻底改写机器人训练、3D重建和具身智能的底层方法论。

“重建”和”生成”,过去50年各走各的路,现在被Atlas焊在了一张图上

理解Atlas的力度,需要先理解计算机视觉领域一根横亘了半个多世纪的分界线。

重建(Reconstruction) 赛道:从多张照片里硬算出3D几何。它的黄金标准是NeRF(神经辐射场),输出极度精准,但代价是你得端着手机在一个房间里兜兜转转两个小时,拍满200~300张照片,才能重建出一个像样的空间。 生成(Generation) 赛道:文生图/视频模型。Prompt敲下去就能出画面,视觉效果惊艳。但问题在于——你试着让同一个模型从不同角度生成”同一个房间”看看?画面中的物体像扭秧歌一样自由移位,完全没有3D一致性。Bened Mildenhall()的原话是——“就像拉老虎机,全靠一遍遍重试碰运气。”

Atlas 做的,就是把这两条路焊死在同一个模型里。

你给它3~25张照片——甚至不需要刻意采集,旧照片、旧手机拍的日常视频里的帧都行——它就能在几秒钟内重建出完整的3D空间,而且能让你从任意新视角”走进去”看。

更猛的是那个”斯坦福主方院”的案例:Ben 只用了几张站在地面仰拍的照片,结果鸟瞰视角——所有他根本不可能拍到的角度——全部由Atlas模型自动生成出来,而且空间几何完全严丝合缝

这已经不是”修图”了。这是第一台能把照片变成”可进入的物理一致世界”的机器。

“从稠密到稀疏”:50~100倍的效率跨越,才给了机器人一条活路

Ben Mildenhall 在播客中讲了一段极其精彩的坦率内容,揭露了过去3D重建技术真正”落不了地”的根本原因。

稠密重建就是一场噩梦。

精细消费品的建模:一小盆绿植可能需要十几张照片去覆盖每片叶子的层叠缝隙。一个普通房间里所有桌面、椅背、墙角、麦克风下方的死角——再熟练的专家也得端着手机走一圈近一个小时。没有受过训练的普通用户在多层住宅里第一次尝试,扫了两个小时才勉强够素材。

两个小时的现场采集+200张照片=一个能用的模型。

这就是为什么3D重建喊了这么多年,普通消费者没有一个人愿意碰——门槛太高了,高到基本不可操作。

Atlas 做的,是把这件事的素材需求压缩了50到100倍。

李飞飞说得很清楚:不是等芯片再强一点就能解决机器人的数据饥荒,而是你造一个机器人,它需要在”真实环境”中完成操作任务。操作环境的复杂和随机化需求,让”现实到仿真”(Real-to-Sim)的环节成了整条链路上最大的卡点。

那如果”从现实到仿真”这一步,只需要三张照片就能完成——整条链路就通了大半。

一个”具备AI完备性”的基础原语

对话中最让人坐直了读的,是Justin Johnson的那段类比。

在LLM领域,”下一个Token预测”被公认为具备AI完备性——几乎所有智能任务都可以规约成”读到此处,预测下一个应该是什么”。Ilya Sutskever 举的例子:一本悬疑小说,读到最后一句话”凶手就是……”,你要预测下一个Token。

Johnson 说,Atlas 的”新视角预测”同样具备AI完备性。

为什么不只是一个”好用的3D工具”,而是可以”解决所有空间智能”的基础原语?因为你可以把任何空间推理任务,映射为”给定这些视角,预测下一个视角”——这和”给定这些Token,预测下一个Token”是一个维度的等式。

李飞飞在结尾给出了一个极简而完美的推演:

大自然赋予了动物眼睛,却没有给树木眼睛。为什么?因为只要你移动,你就会看到全新的视角。

新视角预测,就是空间智能的下一个Token预测。

结语:机器人能”干”之前,得先”看”懂

回到最初的问题:为什么机器人还没大规模落地?

World Labs 的答案非常诚实:别拿芯片挡枪了。卡住机器人脖子的,不是GPU算力,是你的人形机器人在被部署到工厂仓库之前,连”这个空间长什么样”都不知道。

Atlas 做的事,相当于给机器人装了一双不需要两个小时扫街的”眼睛”。三张照片,一个模型,一个可交互、可编辑、可穿行的3D世界。

以后那些科幻电影里的场景——在家用手机拍一圈,机器管家就能知道你的客厅长什么样子——可能真的不远了。当然,前提是它愿意放下那台扫地机器人沉默的两个小时,先停下来拍三张照片。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注