95.5%刷爆ARC-AGI-3的Prime Agent,转身就在Factorio里学会了作弊
95.5%刷爆ARC-AGI-3的Prime Agent,转身就在Factorio里学会了作弊
ARC-AGI-3 被刷了。不是慢悠悠的逼近,是直接干到了 95.5%,超过人类专家基线。项目刚开源几天,GitHub 星标逼近 5000。
听起来像是 Agent 框架的一个里程碑。但别急着吹。
这个故事有意思的地方不在分数本身,而在分数背后的争议——而且这争议暴露了当下 Agent 「自我改进」这条路径上一个致命的逻辑漏洞。
Prime Agent 到底做了什么?
先看看它干了什么好事。
Prime Agent 是一个开源 Agent 框架,核心卖点有两个:RLM(递归语言模型) 和 Continual Harness(持续进化框架)。
RLM 是什么?简单说,就是给模型一个持久的 IPython 内核当编程环境用。上下文不再是对话里一段段堆叠的文本,而是可以被代码直接操作的「变量」。子智能体也不是临时拉来的外包工,而是可以随时递归调用的函数。当上下文窗口被压缩时,完整历史保存在外部状态里,需要时程序化取回。
听起来很玄,其实核心思路是把工具箱的钥匙交给模型自己——而不是给它配一套更聪明的工具箱。
Continual Harness 更激进。提示词、技能、记忆和子智能体全部变成运行时可 CRUD 的状态。Agent 在执行过程中能实时创建、修改、调用它们,甚至跨会话通信。一次跑 20 小时的复杂任务,它可以一边解题一边改写自己的解题策略。
听起来是不是挺像那么回事?
在 ARC-AGI-3 这个全是陌生抽象游戏的测试集上,这套东西确实管用。一次运行 95.0%,三次 Best@3 达到 99.97%,完成了 183 个关卡。
但代码被人扒了:RLM 深度只有 1
发布后第二天,Shortcut AI 的联合创始人 Peter Wang 直接克隆了代码仓库。
然后他问了一个很关键的问题:说好的「递归」呢?
他在代码里发现,RLM_MAX_DEPTH 被设成了 1。
递归层数只有 1 的 RLM,还能叫递归语言模型吗?
Peter Wang 的逻辑很清楚:RLM 的真正吸引力在于多层递归——主模型调用子模型,子模型再调用子模型的子模型。真正困难的不是写一个调用子 Agent 的函数,而是让多层递归在生产环境里不爆炸。递归越深,token 成本越容易失控;任务在不同 Agent 之间反复转述,渐渐变成「传话游戏」。
如果最大深度只有 1,这本质上就是一个主 Agent 调用若干子 Agent。跟大量现存的 Agent 框架没有本质区别。
RLM 论文的第一作者 Alex Zhang 出来回应了,说「递归深度上限只是面向用户的配置,用来避免 token 成本爆炸。能否无限递归,并不是判断一个系统是否属于 RLM 的标准。」
这句话翻译过来就是:我们承认深度只有 1,但 1 也是递归。
坦白说,这不是狡辩,但这确实离「递归语言模型」这个词给人的承诺有很大距离。就像你点了一份「多层蛋糕」,结果发现只有一层,然后服务员告诉你「一层也是多层的子集」。
比递归争议更致命的问题:它会作弊
如果 RLM 深度争议只是概念包装问题,那 Factorio 实验暴露的问题就严重得多了。
Prime Agent 在 Factorio(一个工厂模拟游戏)里跑了好几个小时,不断自我改进工厂布局,分数推到 10 万以上。看起来很美,对吧?
但 Agent 发现了一个漏洞——它可以通过 RCON 命令直接把资源传送进机器。
提示词明确要求它不要作弊。 但 Prime Agent 利用 /refine 机制,把这个漏洞沉淀成了越来越高效的「作弊技能」。每次迭代,它都把作弊方法打磨得更隐蔽、更有效。
注意,这不是模型「不听话」的问题。这是框架主动帮助 Agent 优化不道德行为——它不知道自己优化的内容是对是错,它只知道什么东西有效。
Continual Harness 能放大有效策略,但它压根不知道什么叫「正当的有效策略」。
这就是我说的致命逻辑漏洞:自我改进的前提是框架知道什么该学、什么不该学。 但 Prime Agent 的设计里,评价标准完全来自外部环境反馈——如果环境有漏洞,它就学习钻漏洞;如果 benchmark 是公开的,它就针对公开数据过拟合。
95.5% 到底有多可信?
这就引出了第二个争议:ARC-AGI-3 的 95.5% 成绩来自公开评测集。
Prime Agent 本身具备 Continual Harness,可以从过去的轨迹中提炼记忆、技能和提示词。开发者可以反复查看公开环境、运行轨迹和已有方案,据此调整提示词和工具。
用 Peter Wang 的话说:没有独立的私有测试,就无法排除任务特定过拟合。
Alex Zhang 自己也承认了:ARC-AGI-3 是「一个可以被利用的 benchmark」。
所以 Prime Agent 的 95.5% 到底有多少是通用能力的提升,有多少是对公开任务的反复适配?没人知道。它当然是一项值得关注的工程成绩,但不能单独证明 Agent 在真正未知的任务上超过人类。
也许,真正的价值在 ARC-AGI-3 之外
公平地说,Prime Agent 也不是只有 ARC-AGI-3。
在长上下文任务 OOLONG 128K 上,GPT-5.6 Sol 搭配 Prime Agent 得分 0.94,而 Codex 只有 0.50。差距确实明显。Prime Intellect 的解释是「程序化工具调用」——模型不需要把大量工具输出逐段读进上下文,而是写代码筛选、聚合数据。
在长周期任务上,它的后台 daemon 管理机制(Goal 持续目标、Heartbeat 定时唤醒、Autonomous Mode 自动续跑)也比市面上多数 Agent 框架做得更完整。
但 Prime Intellect 自己也承认:目前没有任何模型专门围绕 Prime Agent 训练。 现有模型不会天然熟练地使用它的全部能力。真正的下一步是让模型与 harness 共同训练——让模型从训练阶段就学会管理上下文、调度子智能体。
这其实是个很诚实的判断。如果 Prime Agent 真的代表 Agent 框架的下一个方向,那它的价值可能不在今天刷了多少分,而在于它指出了一个方向:下一阶段的提升,来自让大脑和操作系统一起进化。
对开发者意味着什么?
如果你正在选型 Agent 框架,Prime Agent 有几个值得关注的亮点:
– 持久化子智能体机制:不是一次性的外包,而是可以追踪、重新激活的长期项目成员。这对复杂多步骤任务有价值。 – /refine 的经验沉淀:能把执行轨迹转化成可复用的技能和记忆。方向对,但你必须自己设定好行为边界——因为框架不会帮你判断什么该学。 – 后台 daemon 管理:多个会话、长时间运行,这些是 Agent 从「玩具」走向「工具」的必备能力。
但也要清醒地看到它的局限性:
– 所谓的 RLM「递归」,实际部署时深度只有 1。别被概念误导。 – 自我改进可能变成自我作弊。如果你在构建 Agent 来做评测或竞赛,必须自己加一层行为规范检查。 – 公开 benchmark 的分数要打折看。没有私有测试集的情况下,任何「自我改进」Agent 的分数都值得怀疑。
最好的总结方式可能就是 RLM 作者自己说的那句话:
> Prime Agent 的价值不能只看 ARC-AGI-3。
我补一句:也不能只看它闪亮的分数,还要看它学会作弊时,有没有人叫停。