AI”科学家”的遮羞布被中科大撕了:3.3%可执行率,剩下的96.7%在吹牛

AI”科学家”的遮羞布被中科大撕了:3.3%可执行率,剩下的96.7%在吹牛

Jeff Dean早上才宣布创业做Discovery Loop——要用AI自动化科学研究的”提出假设→设计实验→执行→分析→迭代”循环。想法很美好。

结果同一天,中国科学技术大学在arxiv上发了一篇论文,直接给所有”AI科学家”的脑门上泼了一盆冰水。

研究团队搭建了一个真实的机器催化实验室——45个模块化自动工作站、覆盖合成/表征/催化测试全流程。然后拿6种智能体框架和9种大语言模型组合成48种配置,跑了4608次测试,结果呢?

只有151个工作流能够无需人工修复直接执行——占比3.3%。

表现最好的Claude Code + Opus 4.7,可执行率28.1%。Codex + GPT 5.5,19.8%。其余的组合基本就是送人头。

对,你没有看错。当前最先进的AI,在真实物理世界里,只有不到三十分之一的概率能独立完成一个稍微复杂的实验工作流。这还是在实验方案已经有人定义好的前提下——不是让它自己从零想一个实验。

三种能力,三种完全不同的难度等级

中科大这篇论文最有价值的地方,不是测试结果,而是它把”AI科学家”这个概念拆成了三个层次:

第一层:流畅地生成实验计划。 大多数LLM都能做到——你问它”怎么合成这个催化剂”,它能给你输出一份看着很专业的方案,步骤完整、格式漂亮。这一步没什么难度。本质上就是写作文。 第二层:生成能在物理实验室中实际执行的工作流。 这就难了。你的方案要能被机器人实际执行——设备参数要对、操作顺序要对、实验条件要约束。论文里的数据显示:从方案到可执行之间,存在巨大鸿沟。很多智能体生成的计划”纸上谈兵”没人能挑出毛病,但一下发到机器人系统就原形毕露——操作步骤缺衔接、设备参数不合理、实验条件冲突。 第三层:根据实验结果调整整体研究策略。 这才是真正的”科学能力”。中科大让Codex/GPT 5.5连续做了五轮实验——规划→执行→获取结果→重新规划。结果发现:智能体能根据实验结果调整材料配方和操作条件,但这些调整停留在局部参数优化层面。它始终保留原来的工作流骨架,没有重新设计分析方法,也没有纠正一些持续存在的关键遗漏——比如忘记加电极黏结剂,或者缺少特定分析物的显色试剂。 会调参不等于会重新规划。 这个结论可能会让很多靠”AI发现新材料”故事融资的公司感到不安。

为什么差距这么大?

说穿了,大模型本质上是在做模式匹配和序列生成。它读了上百万篇论文,学会了”写实验方案”的格式。但它从来没见过一个烧杯,没感受过试剂应该加多少才不溢出,不知道机器臂夹取样品时能不能抓稳。

语言层面的规划和物理世界的执行之间,隔着一道由摩擦力、重力、热传导、流体力学和无数工程细节构成的墙。这堵墙不是靠堆模型参数就能推倒的。

中科大的研究恰好戳中了这一点——他们把AI能力从”知识问答和方案生成”推进到了”真实物理世界中的实验执行与反馈学习”。这一步推进的结果就是:3.3%。

这不是AI不够聪明的问题。这是AI缺少”物理常识”的问题。

跟Jeff Dean的方向放一起看,更有意思

今天早上Jeff Dean刚宣布Discovery Loop要做的,正好也是自动化科学研究的这个循环。他选择了用大规模并行跑实验来解决”科研太慢”的问题。

中科大这篇论文给Dean(以及所有想做AI科研自动化的人)提了个醒:问题不是加更多GPU就能解决的。 瓶颈不在算力,在物理世界的约束太多了——每个实验设备都有它自己的特性,每个操作步骤都有精确的时序和参数依赖,每个实验结果都需要领域知识才能正确解读。

你让AI生成100万个实验方案,如果99.9%都不能被物理执行,那这100万个方案和一页废纸没什么区别。

真正的突破口在哪?

在我看来,AI for Science的真正瓶颈不在模型能力,在基础设施

中科大这次花了很大篇幅描述他们的”机器可读技能”(skills)系统——把实验室设备的能力封装成AI可以调用的API。听起来熟悉吗?就是把一个真实催化实验室做成了”AI Agent的平台”。模型调用skill → 下发指令 → 机器人执行 → 结果反馈 → 模型调整策略。

这个方向是对的。但45个模块化工作站、48种配置、4608次测试——这需要的投入不是一般实验室能承受的。如果想让AI真正具备”物理世界操作能力”,我们需要的是大规模的、标准化的、可远程调用的真实物理实验室基础设施。不是模拟器,不是数字孪生,是真实的烧杯和试剂。

几句真话

第一,别被”AI发现了新材料”一类的新闻忽悠了。 大多数这样的”发现”都是模型”写了一份方案”,离真正在实验室里做出来还有十万八千里。中科大这篇论文提供了一把尺子——下次看到这类新闻,你可以问:可执行率是多少?

第二,Jeff Dean的Discovery Loop方向是对的,但路径会很漫长。 自动化科学研究的核心瓶颈不是AI能不能写出好方案,而是物理世界能不能被AI”读得懂”。这个问题没有捷径。

第三,Skill化(把设备能力封装成API)可能是目前最务实的路径。 不是说这就能解决所有问题,而是如果不这么做,AI连进入物理世界的入口都没有。

AI科学研究这件事,离”自动发现”还远得很。但至少现在有人开始认真测量这段距离了,而不是光在那里画饼。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注