AI开始给自己写驱动了:Fable 5的”超级内核”,是递归自我提升的起点还是终点?

AI开始给自己写驱动了:Fable 5的”超级内核”,是递归自我提升的起点还是终点?

2.5小时,55万Token,一次写成。

Fable 5在KernelBench-Mega基准测试中,用纯CUDA手搓内核,速度狂飙18.7倍,把第二名Claude Opus 4.8甩开4倍多,把GPT-5.5甩开4倍多。

更反直觉的是,上下文越长,它竟然跑得越快——2K上下文时领17.8倍,8K时扩大到18.9倍,拉长到16K时,直接狂飙到了19.5倍。

Anthropic联创Jack Clark在最新一期Import AI里,直接下了一个判断:这标志着”递归自我提升”(RSI)循环的正式开启。

这是AI开始给自己写驱动的信号。

什么是”超级内核”?

所谓”超级内核”(megakernel),就是把整套推理流程压进一个内核里一口气跑完,中间不落地、不切换。

这是GPU编程里,公认最难啃的写法之一。人类工程师做起来都头大,此前榜单上从没有任何模型真正做出来过。

Fable 5写出的,是KernelBench-Mega史上第一个真正的”超级内核”。

通过torch.profiler可以看到一个惊人的细节:解码每一个Token时,Fable 5的内核只启动了”刚好一次”的协作。

int4解量化、卷积、SiLU、KDA门控delta状态、MLA吸收隐变量注意力、MoE路由加top-8专家、各种RMSNorm,甚至连KV缓存的写入——全都塞进这一次启动里,靠14道网格屏障分阶段跑完。

而其他所有高分模型,全都得把问题拆成4-14次独立的内核启动,才能勉强跑完。

一次,对十四次。

这个差别不是玄学。每启动一次内核,GPU都要停一停、交接一次,中间的空转都是白白流掉的时间。别人拆成十几次,Fable 5却把所有活攒成一次干完。省下的,全是纯粹的性能。

为什么上下文越长,跑得越快?

这通常违反直觉。

随着上下文拉长,KV Cache必然膨胀,单Token的注意力计算量随之激增。这通常是解码内核性能”大出血”的重灾区。

但Fable 5极其硬核地把所有计算强塞进”单次启动”(Kernel Launch)中,极大摊薄了固定的屏障同步开销;同时,其int4的计算效率死死咬住了硬件的内存带宽上限。

结果就是,在别人遭遇瓶颈时,它与基准线的差距不仅没有缩小,反而随着压力的增加越拉越大。

2.5小时,55万Token一次写成

Fable 5写内核的过程,没有一上来就狂敲代码。

整场会话,它用了64%的时间在沉默——安静地给基准线计时、给网格屏障做微基准、推导出一条”每token约29倍字节”的roofline上限。

做完这些功课,它才一口气把整个内核写完,第一次跑分就直接命中14.4倍。

然后,它用最后一个小时删屏障、把int4反量化压榨到几乎”免费”,一路把自己送上18.7倍。

中途试过一次负优化,测完当场回滚,没有半句自我辩解,只认数据。

整个过程:2.5小时,约55万token。

这里,最容易被忽略的一点是——Fable 5,还只是Anthropic内部模型Claude Mythos的”安全版本”。

递归自我提升(RSI)循环,开始了?

Anthropic联创Jack Clark在最新一期Import AI里,直接下了一个判断——这标志着”递归自我提升”(RSI)循环的正式开启。

这一期的副标题,他只留了一句话:这是一个新世界的开端吗?

他的逻辑很直白:能自主开发和优化内核,是做AI研发最底层的输入任务之一。

AI越会写内核,训练和推理就越快;越快,下一代就越强;越强,写内核又更狠——这个飞轮一旦转起来,就不太需要人再推了。

Fable 5不只在”造自己”这件事上领先,它连人类的活也开始接了。

最近,在Remote Labor Index(远程劳动指数)上,AI的完成率从2025年10月上线时的2.5%,一路涨到了2026年7月。不到八个月,前沿水平翻了两番还多。

Clark表示,AI拓展自身经济边界的速率,正在全面反超人类重构”比较优势”的速度。

我的判断:这是起点,不是终点

1. 从”AI写代码”到”AI写驱动”

过去,AI写代码的能力已经很强,但主要是写应用层代码。

但从Fable 5的”超级内核”可以看出,AI已经开始写底层驱动代码——GPU内核。

这意味着什么?

意味着AI正在从”应用层”向”基础设施层”渗透。

这需要两个能力:一是对硬件行为的深入理解,二是对性能优化的极致追求。

2. “递归自我提升”的飞轮效应

Jack Clark的判断说明了一个问题:AI写内核的能力,正在形成一个飞轮。

AI越会写内核,训练和推理就越快;越快,下一代就越强;越强,写内核又更狠。

这个飞轮一旦转起来,就不太需要人再推了。

未来的AI竞争,将是谁能更快地启动这个飞轮,谁就能赢得市场。

3. “一半狂奔,一半敬畏”

有意思的是,就在同一期Import AI的结尾,Jack Clark写了一篇科幻——一个2050年的世界,”通用计算机”因为太过危险,被人类亲手封禁。

写下”RSI循环开始了”的那个人,转头就在想象一个把通用计算关进笼子的世界。

这大概就是,此刻最真实的”撕裂感”:一半是狂奔,一半是敬畏。

一年多前,KernelBench刚发布时,当时最强的OpenAI o1,在最难的任务上只拿到4%。而今天,AI已经在给自己写驱动了。

人类花了几十年,才把GPU的极限榨到今天这一步。而Fable 5,仅用了2.5小时。

倒计时,或许已经悄悄开始了。

写在最后

Fable 5的”超级内核”,不只是一次性能突破。

它标志着AI开始给自己写驱动,标志着”递归自我提升”循环的正式开启。

从”AI写代码”到”AI写驱动”,从”应用层”到”基础设施层”,AI正在向更底层渗透。

一半是狂奔,一半是敬畏。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注