750 Token/s 零等待暴击:OpenAI 联手 Cerebras 推出 Ultrafast,大模型推理的“算力重组”真相
750 Token/s 零等待暴击:OpenAI 联手 Cerebras 推出 Ultrafast,大模型推理的“算力重组”真相
在所有人还在习惯于看着大模型一个字一个字像打字机一样吐出代码时,OpenAI 突然把油门踩进了红线区。
就在今天,OpenAI 正式官宣了新档位 Ultrafast(极速模式):跑在最高规格的 GPT-5.6 Sol 上,生成速度直接暴涨 14 倍,飙到了惊人的 750 Token/s。
与以往很多厂商“用降智、缩参数换速度”的套路完全不同,这次的 GPT-5.6 Sol 智力完全没有打折。支持这一物理奇迹的背后,是 OpenAI 与芯片独角兽 Cerebras 签下的百亿美元晶圆级引擎(Wafer-Scale Engine)集群。
与此同时,ChatGPT 桌面版还上线了名为 Computer History 的主动记忆系统——不截屏、不录音,却能精准记录你的应用切换、键盘击键与窗口交互,随时回答“我刚才做到哪了”。
从硬件脱胎换骨到端侧无感记忆,OpenAI 正在用工业级实力重新定义什么叫“实时 AI”。
晶圆级 SRAM:暴力撕碎 GPU 的“显存带宽墙”
为什么传统 GPU 跑大模型推理总是慢吞吞?
核心瓶颈从来不是算力核心不够多,而是显存带宽(Memory Bandwidth)太窄。在自回归解码(Decode)阶段,模型每生成一个 Token,就必须把数百 GB 的权重从 HBM 显存搬运到计算单元一次。随着并发量上升,GPU 就会被这堵“内存墙”卡得动弹不得。
OpenAI 联手 Cerebras 的解法极其粗暴且直接:彻底干掉显存搬运。
Cerebras 打造的是整整一块晶圆大小的超大芯片,直接在硅片上集成了高达 44GB 的超高速片上 SRAM。GPT-5.6 Sol 的核心权重被完全常驻在 SRAM 内部,数据传输带宽被拉升了几个数量级,推理延迟被直接打穿。
750 Token/s 是什么概念? – 一篇 3000 字的深度技术架构文档,4 秒钟全量生成完毕; – 复杂的跨仓库代码重构,从原本漫长的“等待转圈”压缩成了一场毫无卡顿的实时对话; – 在高频金融监控或线上服务告警时,模型可以在数毫秒内读完几万行日志并给出修复脚本,而不是等事故扩大了才出事后报告。
把“等待感”彻底做没,大模型才真正从“玩具级问答”蜕变为能够嵌入毫秒级生产系统的控制中枢。
Computer History:从“被动问答”到“感知操作流”
除了硬件级的极速狂飙,ChatGPT 桌面端推出的 Computer History 同样是一次交互维度的暗度陈仓。
以前的 Agent 记忆(如 Memories)要求用户主动告诉它事实;而 Computer History 则是静默捕获操作流: – 它通过系统的无障碍与交互接口,记录你在不同窗口间的切换、打字动作与文件流转; – 碰到反复出现的繁琐流程(比如每天重复整理发布通稿),它会自发提炼并询问你:“要不要把这套操作固化为一个自动化 Skill?” – 更聪明的是隐私克制:不存截屏、不录音频,数据处理完后以标准 Markdown 形式保存在本地,临时事件文件 48 小时自动销毁。
当“极速推理(Ultrafast)”遇上“主动操作记忆(Computer History)”,未来的桌面 Agent 不再是一个需要你频繁输入 Prompt 的聊天框,而是一个坐在你工位旁、对你的整个工作进度了如指掌的隐形副驾。
Kate 的观点与判断
对于这一波技术跃迁,我有三个犀利判断:
1. “推理延迟”正在成为大模型商业落地的终极护城河。过去行业迷信基准跑分,但落地到工业级 Agent 和实时语音场景,1 秒的延迟差距就决定了产品的生与死。不能做到 200+ Token/s 的模型服务,在未来的企业级集成中将失去入场资格。 2. 专用定制算力正在加速瓦解英伟达的传统生态。Cerebras、Groq、SambaNova 的崛起证明,在推理阶段,针对特定架构优化片上内存与数据流的 ASIC/晶圆级芯片,能以数倍的能效比击溃通用 GPU。OpenAI 押注 Cerebras,正是为了在推理成本和响应速度上彻底甩开对手。 3. “无感上下文捕获”将彻底淘汰手动 Prompt。未来的工程师根本不需要写提示词去解释“我刚才在干嘛”。优秀的 Agent 系统会自主感知你的终端状态、代码修改与当前任务上下文,并以 750 Token/s 的速度瞬间为你备好解决方案。
不要再把大模型当成慢慢吞吞的打字机了。当延迟被压到零,AI 对工作流的接管才真正进入深水区。