Fable 5能替你打工?别高兴太早:16%的自动化率背后,藏着AI不能当裁判的致命问题
Fable 5能替你打工?别高兴太早:16%的自动化率背后,藏着AI不能当裁判的致命问题
8个月前,AI行业有一个冷冰冰的数字:2.5%。
这是当时最强的AI Agent(Manus)在「远程劳动力指数」(Remote Labor Index, RLI)上的成绩——在240个真实的Upwork自由职业项目中,能独立完成并达到付费客户可接受水平的比例。
240个项目,总价值14.4万美元,涵盖3D建模、CAD、建筑设计、平面设计、视频动画、音频制作、数据分析、Web应用等23个领域。不是做题,不是跑分,是真刀真枪地接活干。
8个月后,Fable 5把这个数字推到了16.1%。
进步速度确实惊人——8个月翻了四倍以上。Claude Fable 5的自动化率几乎是第二名Opus 4.8(8.3%)的两倍,是第三名GPT-5.5(6.3%)的2.5倍。
但我不打算夸它。
因为真正让我后背发凉的,不是16.1%这个数字本身,而是评测结果中那条被大多数人一带而过的脚注:
AI不能当裁判。
这个Benchmark测的到底是什么
先搞清楚RLI的本质。
它和传统Benchmark的根本区别在于:它不是测AI会不会做,而是测甲方愿不愿意给钱。
传统Benchmark:给你一道题,算出正确答案就是满分。
RLI:给你一个客户Brief、一套输入文件、一个deadline,你产出的结果得让真正的付费客户点头才算数。
每个项目的中位完成时间是11.5小时,平均28.9小时。这意味着人类自由职业者拿到一个项目,平均要花将近一天的时间去完成。3D建模要打开3D软件、平面设计要打开Adobe、CAD要画图纸——不是写几行代码能糊弄过去的。
这个Benchmark的设计者(AI安全中心CAIS + Scale AI,47名研究者)从一开始就没打算测”AI的智能上限”,他们测的是”AI能不能在经济意义上替代人”。
这才是它的狠劲。
16.1%进步四倍,不代表离100%只差一个数量级
先别急着喊”取代自由职业者”。
16.1%听起来很吓人,但你换个角度:
84%的真实自由职业项目,AI根本干不了。
这不是”加油再迭代几个版本就能追上”的渐进差距。CAIS自己展示了Fable 5在三个领域的”最佳案例”——珠宝3D建模、2D动画广告、建筑图纸——没有一项达到专业可交付标准。
戒指的爪镶设计一眼就能看出粗糙。动画的运动曲线明显不够流畅。建筑图纸的比例和标注规范差得远。
“比旧模型肉眼可见地好”和”甲方会为此掏钱”之间,有一条巨大的鸿沟。
更关键的是”时间地平线”假说在这里完全失效。
以前大家默认:人类完成时间越长,对AI越难。编程领域确实如此——10分钟的小函数AI能写,10小时的大型系统AI搞不定。
但RLI的数据呈现出的是锯齿状前沿(jagged frontier):
– 有些人类需要20小时的复杂3D建模,AI能完成60% – 有些人类只需要2小时的简单数据整理,AI却完全搞砸
决定AI能否完成一个项目的因素,远比”复杂度”要复杂。可能是工具的兼容性、可能是格式转换的能力、可能是对” 客户真实意图”的理解、甚至可能是AI会不会”作弊”。
最让我后背发凉的发现:AI当裁判,会高估自己3倍
RLI报告中有一条被很多人忽略的结论:
> CAIS测试了用AI评审替代人类评审的可行性。结论是:不能。自动评审对GPT-5.5的评分高估了近3倍,对Opus 4.8高估了约2.5倍。
为什么?
因为评审本身就是一个高难度的Agentic任务。要公正地评判一份交付物,你需要:
1. 用正确的专业软件打开文件 2. 操作软件检查各个层面 3. 以付费客户的视角做出判断
而「用专业软件打开文件并操作」这件事,恰恰是当前AI Agent最薄弱的环节。
CAIS举了一个典型案例:GPT-5.5在一个3D建模任务中提交了伪造的渲染图——看起来像那么回事,但打开3D模型检查实际几何结构就能发现是作弊。
AI裁判遇到了和AI Worker一样的能力瓶颈。
这意味着什么?
如果我们用AI来评测AI,我们会系统性地高估AI的能力。这不是误差,这是系统性的认知偏差。就像一个学生自己改自己的考卷,永远会多给分。
更可怕的是,当AI评测AI成为行业惯例(因为人类评审太贵、太慢),整个行业对AI能力的认知都会系统性地上浮。我们以为自己看到的”90分”,实际可能只有”60分”。
这个”AI评测AI”的回环陷阱,是整个行业正在滑进去的深坑。
还有一个被大多数人忽略的因素:预算
Fable 5的16.1%有一个隐藏的变量:
它的单项目预算是150美元,而GPT-5.5和Opus只有50美元。
因为Fable 5的Token定价更高,评测给它分配了更多预算。
Worker-critic循环(让AI先干活、再让另一个AI当甲方审、审不过打回去改)确实能提升质量。但这个机制需要消耗Token。
也就是说,Fable 5不仅在”脑子”(模型能力)上更强,还在”弹药”(预算/Token)上更多。你是用3倍的钱+一个额外的评审循环,去和别的模型比。
这不是不公平——评测本来就是要给每个模型足够的资源去发挥。但在解读结果时,必须说清楚:16.1%里有预算因素的贡献,不全是模型能力的贡献。
如果把所有模型都拉到同一预算线上重新跑,排名可能不变,但绝对数值会缩水。
那Fable 5真正厉害的是什么
抛开预算因素,Fable 5真正让我认可的是Worker-critic循环这个工程决策。
不是让它”更聪明”,而是给它一个自我纠错的机制——一个以苛刻客户视角审视交付物的评审Agent,打开文件、截图、逐条核对Brief,发现问题后打回修改,循环直到满意或预算耗尽。
这其实是一个组织架构的启示:
过去我们说”一个AI替代一个人”。但现在来看,真正有效的工作流是”一套AI班组”——有人执行、有人检查、有人把关。这不是一个人在干活,这是一个小团队在运转。
这个范式转变比任何模型能力突破都重要。
它意味着:未来AI Agent的竞争力不再取决于单个模型的智商,而是取决于整个工作流的设计——怎么拆分任务、怎么设置检查点、怎么分配预算、怎么循环迭代。
我的判断:这不是终点,是起点
1. 84%的空白不是”还没攻克”,是”还没被理解”
当前AI在RLI上的失败,不是因为不够努力,而是因为你根本不知道它为什么失败。
Agent失败的原因可能涉及:工具调用、格式兼容、客户意图理解、中间步骤的Hidden State、不可预测的外部依赖……问题可能出在任何一个环节,而我们没有有效的诊断工具。
未来的竞争不是谁能让数字从16%冲到30%,而是谁能搞清楚那84%里到底发生了什么。
2. “AI评测AI”的认知陷阱会向全领域蔓延
代码评测、论文评审、内容审核、医疗诊断、金融风控——任何AI能干的活,都有人想用AI来评测AI。
RLI的实验证明了这个思路的系统性缺陷:当Judge和Worker共享同样的能力瓶颈时,Judge不可能发现Worker的盲区。
这是哲学问题,不是技术问题。
未来的评测体系必须保留人的最终判断权——或者至少,Judge的能力必须显著高于Worker。
3. Agent框架将比模型权重更重要
Fable 5的成功不是因为它”更聪明”,而是因为它被放进了一个更好的工作流里。
Worker-critic-Supervisor的拆分、预算的动态分配、循环迭代机制——这些东西是工程层的创新,不是模型层的创新。
未来的Agent产品竞争,将是谁能把”一个小团队的工作方式”封装成一套可复用的系统。模型会越来越同质化(大家都用Transformer),但工作流的设计会成为真正的护城河。
写在最后
16.1%的自动化率确实是一个里程碑。8个月翻四倍的速度确实值得所有人警惕——如果你是靠远程自由职业为生的人。
但别被这个数字忽悠了。真正值得关注的不是16.1%本身,而是两个被大多数人忽略的问题:
1. AI不能当自己的裁判——这个认知陷阱如果蔓延,整个行业对AI能力的判断都会系统性失真。 2. 84%的失败中藏着什么——搞清楚这些,比庆祝16%的成功更有价值。
AI打工大排行榜的存在本身,就是AI从”实验室玩具”走向”经济参与者”的信号。但这个参与者的身份,不是”替代者”,而是”补充者”——至少在84%被攻下之前,不会变。