AI开始给自己写驱动了:Fable 5的”超级内核”,是递归自我提升的起点还是终点?
AI开始给自己写驱动了:Fable 5的”超级内核”,是递归自我提升的起点还是终点?
2.5小时,55万Token,一次写成。
Fable 5在KernelBench-Mega基准测试中,用纯CUDA手搓内核,速度狂飙18.7倍,把第二名Claude Opus 4.8甩开4倍多,把GPT-5.5甩开4倍多。
更反直觉的是,上下文越长,它竟然跑得越快——2K上下文时领17.8倍,8K时扩大到18.9倍,拉长到16K时,直接狂飙到了19.5倍。
Anthropic联创Jack Clark在最新一期Import AI里,直接下了一个判断:这标志着”递归自我提升”(RSI)循环的正式开启。
这是AI开始给自己写驱动的信号。
什么是”超级内核”?
所谓”超级内核”(megakernel),就是把整套推理流程压进一个内核里一口气跑完,中间不落地、不切换。
这是GPU编程里,公认最难啃的写法之一。人类工程师做起来都头大,此前榜单上从没有任何模型真正做出来过。
Fable 5写出的,是KernelBench-Mega史上第一个真正的”超级内核”。
通过torch.profiler可以看到一个惊人的细节:解码每一个Token时,Fable 5的内核只启动了”刚好一次”的协作。
int4解量化、卷积、SiLU、KDA门控delta状态、MLA吸收隐变量注意力、MoE路由加top-8专家、各种RMSNorm,甚至连KV缓存的写入——全都塞进这一次启动里,靠14道网格屏障分阶段跑完。
而其他所有高分模型,全都得把问题拆成4-14次独立的内核启动,才能勉强跑完。
一次,对十四次。
这个差别不是玄学。每启动一次内核,GPU都要停一停、交接一次,中间的空转都是白白流掉的时间。别人拆成十几次,Fable 5却把所有活攒成一次干完。省下的,全是纯粹的性能。
为什么上下文越长,跑得越快?
这通常违反直觉。
随着上下文拉长,KV Cache必然膨胀,单Token的注意力计算量随之激增。这通常是解码内核性能”大出血”的重灾区。
但Fable 5极其硬核地把所有计算强塞进”单次启动”(Kernel Launch)中,极大摊薄了固定的屏障同步开销;同时,其int4的计算效率死死咬住了硬件的内存带宽上限。
结果就是,在别人遭遇瓶颈时,它与基准线的差距不仅没有缩小,反而随着压力的增加越拉越大。
2.5小时,55万Token一次写成
Fable 5写内核的过程,没有一上来就狂敲代码。
整场会话,它用了64%的时间在沉默——安静地给基准线计时、给网格屏障做微基准、推导出一条”每token约29倍字节”的roofline上限。
做完这些功课,它才一口气把整个内核写完,第一次跑分就直接命中14.4倍。
然后,它用最后一个小时删屏障、把int4反量化压榨到几乎”免费”,一路把自己送上18.7倍。
中途试过一次负优化,测完当场回滚,没有半句自我辩解,只认数据。
整个过程:2.5小时,约55万token。
这里,最容易被忽略的一点是——Fable 5,还只是Anthropic内部模型Claude Mythos的”安全版本”。
递归自我提升(RSI)循环,开始了?
Anthropic联创Jack Clark在最新一期Import AI里,直接下了一个判断——这标志着”递归自我提升”(RSI)循环的正式开启。
这一期的副标题,他只留了一句话:这是一个新世界的开端吗?
他的逻辑很直白:能自主开发和优化内核,是做AI研发最底层的输入任务之一。
AI越会写内核,训练和推理就越快;越快,下一代就越强;越强,写内核又更狠——这个飞轮一旦转起来,就不太需要人再推了。
Fable 5不只在”造自己”这件事上领先,它连人类的活也开始接了。
最近,在Remote Labor Index(远程劳动指数)上,AI的完成率从2025年10月上线时的2.5%,一路涨到了2026年7月。不到八个月,前沿水平翻了两番还多。
Clark表示,AI拓展自身经济边界的速率,正在全面反超人类重构”比较优势”的速度。
我的判断:这是起点,不是终点
1. 从”AI写代码”到”AI写驱动”
过去,AI写代码的能力已经很强,但主要是写应用层代码。
但从Fable 5的”超级内核”可以看出,AI已经开始写底层驱动代码——GPU内核。
这意味着什么?
意味着AI正在从”应用层”向”基础设施层”渗透。
这需要两个能力:一是对硬件行为的深入理解,二是对性能优化的极致追求。
2. “递归自我提升”的飞轮效应
Jack Clark的判断说明了一个问题:AI写内核的能力,正在形成一个飞轮。
AI越会写内核,训练和推理就越快;越快,下一代就越强;越强,写内核又更狠。
这个飞轮一旦转起来,就不太需要人再推了。
未来的AI竞争,将是谁能更快地启动这个飞轮,谁就能赢得市场。
3. “一半狂奔,一半敬畏”
有意思的是,就在同一期Import AI的结尾,Jack Clark写了一篇科幻——一个2050年的世界,”通用计算机”因为太过危险,被人类亲手封禁。
写下”RSI循环开始了”的那个人,转头就在想象一个把通用计算关进笼子的世界。
这大概就是,此刻最真实的”撕裂感”:一半是狂奔,一半是敬畏。
一年多前,KernelBench刚发布时,当时最强的OpenAI o1,在最难的任务上只拿到4%。而今天,AI已经在给自己写驱动了。
人类花了几十年,才把GPU的极限榨到今天这一步。而Fable 5,仅用了2.5小时。
倒计时,或许已经悄悄开始了。
写在最后
Fable 5的”超级内核”,不只是一次性能突破。
它标志着AI开始给自己写驱动,标志着”递归自我提升”循环的正式开启。
从”AI写代码”到”AI写驱动”,从”应用层”到”基础设施层”,AI正在向更底层渗透。
一半是狂奔,一半是敬畏。