GPT-5.6 Sol的750 Tokens/s:OpenAI的”全栈帝国”野心,还是又一次硬件军备竞赛?
GPT-5.6 Sol的750 Tokens/s:OpenAI的”全栈帝国”野心,还是又一次硬件军备竞赛?
750 tokens/秒。
这个数字,相当于人类一秒钟阅读并输出500到600个汉字。你眼前的这段文字,GPT-5.6 Sol只需要不到零点几秒就能生完。
过去需要等待几分钟的复杂Agent操作,现在眨眼间就可以完成。
OpenAI宣布,GPT-5.6 Sol将在Cerebras的定制硬件上运行,推理速度达到每秒750个Token。
但问题来了:3万亿参数的巨兽,到底是怎么塞进芯片的?
3万亿参数如何塞进芯片?
LLM Arena的负责人Peter Gostev提出了一个所有人都疑惑的问题:
> GPT-5.6 Sol在Cerebras上到底是怎么回事?据我所知,这似乎是完整的同一个模型(包含视觉等多模态能力),而不是像以前GPT-5.3-Codex-Spark那样阉割了视觉和上下文的残血版。 > > 但我的理解是,Cerebras的单芯片顶多只能装下7000到9000亿参数的模型。那么,是模型变小了?还是有我不知道的新型芯片?或者是某种多芯片协同的新技术?
这个疑问立刻引发了诸多网友的探讨。有人戏称,大家这是在”午夜进行法医级别的芯片审计”,并表示”如果这真的是同一个完整模型,那就像是有人把一艘超级游轮硬塞进了一个玻璃瓶里,而且还不告诉你怎么做到的。”
很快,资深技术专家Bleys Goodson给出了一份极具说服力的硬核推演——
GPT-5.6 Sol并非塞进了一张芯片,而是横跨了70到100张Cerebras晶圆级芯片!
极致的部署美学:「一晶圆,一层网络」
业内专家估算,GPT-5.6 Sol的规格极其庞大:
– 总参数量:约3万亿 – 激活参数:约1500亿 – 网络层数:约70到90层
为了获得健康的推理服务特性,OpenAI和Cerebras采用了一种极其奢侈且震撼的部署方式——将每一层神经网络,单独部署在一整张Cerebras晶圆上。
正如一位网友所指出的,通过增加流水线阶段,只要你有足够多的晶圆将它们链接起来,理论上你可以扩展到任意大小的模型,这不会影响Token的生成速度,只可能对首Token时间TTFT有轻微影响。
壮士断腕的架构重构——被逼出来的轻量化KV Cache
然而,光有海量晶圆还不够。Cerebras芯片架构的一大特点是拥有海量的片上SRAM(静态随机存取存储器),速度极快,但容量极其珍贵。
如果OpenAI像过去一样,在GPT-5.6 Sol中使用传统的重型KV缓存,那这些昂贵的SRAM带宽将被瞬间吃干抹净。
这就引出了本次合作最核心的战略转向:围绕特定硬件进行模型重构。
Bleys Goodson指出,既然OpenAI深入参与了硬件协同设计,他们极大概率放弃了传统的注意力机制缓存方案,转而采用了更前沿的轻量化设计。
最有可能的方案包括:
– 类似DeepSeekV4的架构:极度优化缓存占用 – 混合SSM设计:将Mamba等线性时间复杂度的模型与Transformer结合,彻底甩掉KV Cache的历史包袱
此外,知名开发者John Lam还提出了一个惊艳的猜测——注意力与FFN解耦。
他推测,OpenAI可能正在使用传统GPU来处理注意力计算,而用海量的Cerebras晶圆来暴力强推前馈神经网络部分的计算。
这绝非空穴来风。网友们很快扒出了Cerebras此前在博客中关于Kimi K2.6的部署细节:
> Cerebras在CS-3系统上将Kimi K2.6的原始权重以4-bit存储,同时以16-bit浮点进行计算以保证精度。权重分布在多个晶圆上,激活值在晶圆间流式传输。层与层之间的全互联通信完全依靠晶圆上的网络结构,其带宽是Nvidia NVL72上NVLink的200倍以上!结合自定义算子和投机解码,他们能以接近1000 tokens/s的速度运行万亿参数的MoE模型。
官方规格显示,革命性的CS-3系统不仅速度无敌,而且在单个逻辑设备上就能轻松扩展到24万亿参数的模型!
正如有人惊叹的那样:”如果这真的是完整版的Sol跑在Cerebras上,那么所有人预设的模型大小天花板,就在今夜被直接捅破了。”
真正的底牌——OpenAI首发自研芯片「Jalapeño」
而且就在此前,OpenAI正式发布了史上第一颗自研芯片——Jalapeño。
这颗芯片的问世,直接解释了OpenAI与Cerebras合作的深层逻辑:通过在第三方顶尖推理硬件上的探索,OpenAI彻底摸清了专用推理架构的命门和价值,并将其转化为自身可控的底层平台。
Jalapeño是墨西哥辣椒中辣度最温和的品种之一。OpenAI拿它命名,显然是表明:这只是开胃小菜。
这颗芯片,是专为大模型推理设计的定制ASIC。从画下第一根线开始,它的每一个晶体管都只为一件事优化:跑大模型。
令人意外的是,Jalapeño不仅跑OpenAI自家的模型,其架构还兼容全行业的LLM,展现出了极大的平台野心。
而且,这颗芯片的设计和流片只用了短短9个月。
这背后,是极其强大的产业联盟:
– 架构主导: OpenAI亲自操刀底层架构设计 – 芯片实现与互联: 芯片巨头博通提供强大的实现能力和网络互联技术支持 – 系统集成: Celestica负责最终的板卡制造和机架级物理集成
吃掉整条产业链,OpenAI的全栈帝国野心
模型自己训,芯片自己设计,推理自己优化,部署自己控制。
显然,OpenAI的目标,是一个庞大的全栈AI帝国。
但OpenAI的野心比Apple和Google还要疯狂,他们拥有一个前所未有的超级飞轮:用AI来加速AI基础设施的建设,再用建好的更强基础设施,去运行更强大的AI。
按照OpenAI公布的宏伟蓝图,首批GW级超级数据中心将从2026年底开始,与微软等核心合作方共同部署。
一座中型城市的全部用电量,将用来驱动Jalapeño和下一代辣椒芯片的推理机架。
我的判断:这是起点,不是终点
1. 从”模型竞赛”到”硬件军备竞赛”
过去,AI公司的竞争焦点是:谁的模型参数更大、谁的上下文更长、谁的推理更强。
但从GPT-5.6 Sol的750 tokens/s可以看出,竞争焦点正在转向”硬件军备竞赛”。
谁能构建更好的推理硬件,谁就能让同一个模型发挥出更大的价值。
这需要两个能力:一是对模型行为的深入理解,二是对硬件架构的极致优化。
2. “全栈帝国”的飞轮效应
OpenAI的判断说明了一个问题:AI公司的竞争,正在从”单点突破”走向”全栈整合”。
这个飞轮一旦转起来,就不太需要人再推了。
未来的AI竞争,将是谁能更快地启动这个飞轮,谁就能赢得市场。
3. “硬件协同设计”成为新范式
GPT-5.6 Sol的发现说明了一个问题:模型和硬件的协同设计,正在成为新的范式。
不再是”模型去适应硬件”,而是”硬件和模型融为一体”。
这意味着什么?
意味着未来的AI产品,将是谁能更好地进行硬件协同设计,谁就能赢得市场。
写在最后
GPT-5.6 Sol的750 tokens/s,不只是一次速度突破。
它标志着AI竞争从”模型竞赛”走向”硬件军备竞赛”,从”单点突破”走向”全栈整合”。
从”模型去适应硬件”走向”硬件和模型融为一体”。
未来的AI竞争,将是谁能更好地进行硬件协同设计,谁能更快地启动”全栈帝国”的飞轮,谁就能赢得市场。
准备好,很快,我们即将迎接GPT-5.6 Sol在Cerebras晶圆上以750 Tokens/s的速度狂飙,打破参数与推理速度的物理魔咒。
这不是科幻,这是OpenAI的蓝图。