AI飞行客

掠过技术的云层,落地在工程的原野

摸着DeepSeek过河:OpenAI的推理成本战争

摸着DeepSeek过河:OpenAI的推理成本战争

OpenAI年亏209亿美元。

这个数字不是来自某个做空报告,而是OpenAI自己在6月中旬泄露的财务数据。2025年全年收入130.7亿,总成本和费用340亿,运营亏损209亿。光付给微软的云计算账单就超过172亿。

2026年预计还要烧掉141亿在推理和训练上。

当所有人都在讨论GPT-5有多聪明、上下文窗口有多长的时候,OpenAI正在面对一个更现实的问题:聪明一次,到底要花多少钱?

最近外媒报道称,OpenAI找到了一种新的系统优化方案,能把模型推理成本砍掉一半以上。过去几万张GPU才能满足的需求,现在几百张就足够了。

这个优化方向,主要来自KV cache。

更耐人寻味的是,这条路,DeepSeek早就走过了。

KV Cache:模型读完前文后留下的”笔记”

先说KV cache是什么。

一句话概括:KV cache就是模型读完前文后留下的”笔记”。

大模型生成一句话,不是一次性写完的,而是一个token一个token地往外蹦。每蹦一个新token,它都要回头看前面已经出现过的内容,判断下一个该说什么。

如果没有KV cache,模型每生成一个新token,都要把前面整段话重新读一遍、重新算一遍。比如你问了1万字材料,它生成第1个字要读一遍,生成第2个字还要再读一遍,生成到第10000个字还要再读一遍的话,那成本就炸了。

所以KV cache必须放在离GPU计算单元最近、带宽最高、延迟最低的地方,也就是HBM(高带宽内存)里。

HBM越大,意味着GPU能同时装下更多东西:更大的模型权重、更长上下文的KV cache、更多并发用户的缓存。

也正是因为推理对HBM的需求大到这个地步,所以行业才会去拼命地迭代HBM4,英特尔另起炉灶搞ZAM。

HBM4是正统路线,继续堆带宽。JEDEC在2025年4月发了标准,核心变化是内存接口从1024位翻到2048位,单堆栈带宽从HBM3E的1.18TB/s直接拉到2.8TB/s,容量从24GB提到48GB。

ZAM是英特尔和软银旗下SAIMEMORY联合发布的新型显存,全称Z-Angle Memory。它用铜对铜混合键合直接把9层熔在一起,带宽约2.5TB/s,接近HBM4。

但问题是,从H100上的HBM3(819 GB/s)到Rubin上的HBM4(2.8 TB/s),带宽翻了3倍多,然而在AI面前,仍然是无底洞。

OpenAI在走DeepSeek的老路

其实OpenAI盯上KV cache已经不是一两天的事情了。

早在2024年10月的一次开发者文档更新中,OpenAI就加入了Prompt Caching(提示词缓存)机制。Prompt Caching本质上就是对KV cache的复用,模型第一次读完一段前缀后,会生成对应的中间结果;如果后续请求用了相同前缀,系统就可以直接复用这部分KV cache,而不是重新计算整段prompt。

官方文档表示,通过Prompt Caching,最高可以把延迟降低80%,把输入token成本降低90%。

但2024年5月的时候,DeepSeek就提出过类似的想法。

在DeepSeek-v2的技术报告中,DeepSeek团队提出了一个新的机制,叫做Multi-head Latent Attention(MLA)。MLA的核心目的就是压缩KV cache。报告里表示,MLA把KV cache压进latent vector,从而保证高效推理。相较于DeepSeek 67B,DeepSeek-V2的KV cache减少了93.3%,最大生成吞吐提升到5.76倍。

DeepSeek在V4发布后很快调整缓存命中价格,其实也是因为发现KV cache可以复用。

目前GPT并未有类似的折扣机制,所以这次OpenAI推理优化,很有可能是想走DeepSeek走过的路。

摸着DeepSeek过河,这句话不是调侃,是事实。

硬件突围:Jalapeño和Cerebras

OpenAI的省钱策略不只是软件优化,硬件也在同步突围。

6月24日,OpenAI和博通联合发布了Jalapeño。这是OpenAI参与设计的首款AI芯片,从第一行电路设计开始,就是为LLM推理而生的,甚至于它都没办法跑通用任务。

从2025年10月公开宣布合作到2026年6月亮相,Jalapeño只用了9个月。在半导体行业里,一颗新处理器的开发周期通常以年为单位,这个速度有点”太快了”。

OpenAI的官方说法是,能这么快是因为软件和硬件深度协同开发,而且OpenAI用自己的模型,加速了芯片设计中的部分优化流程。用AI设计AI的芯片,然后AI芯片再去跑AI模型。

Jalapeño瞄准的方向就是推理。据外媒报道,Jalapeño能把LLM服务成本砍掉约50%。如果叠加上这次KV cache方面的优化,那OpenAI的推理成本,恐怕会降低一个数量级。

更关键的是,Jalapeño还不是OpenAI在推理芯片这方面下的唯一筹码。

2026年1月14日,OpenAI和Cerebras签下了一份超过100亿美元的协议。协议中提到,后者给前者提供750MW的推理算力,持续到2028或2029年。未来可能还将扩展到2GW。

Cerebras不一样,它是直接造一颗跟整片硅晶圆一样大的芯片。WSE-3,4万亿个晶体管,90万个计算核心,44GB片上SRAM。一块芯片的内存带宽是英伟达B200的2625倍。

这么做的好处在于降低通信成本。在传统的GPU集群里,数据传输要在芯片之间、节点之间跳来跳去,通信成本非常大。Cerebras把所有东西放在一块晶圆上,省掉了绝大部分通信延迟。结果就是推理速度可以比GPU方案快15倍。GPT-5.3-Codex-Spark在Cerebras上跑到了超过1000 tokens/秒。

目前,Cerebras CEO确认,GPT-5.4已经可以在Cerebras硬件上跑起来了,在未来,GPT-5.5也会运行在Cerebras的硬件上面。

而且不只是OpenAI,AWS在6月宣布和Cerebras合作搞”推理分解”(inference disaggregation),把推理拆成prefill和decode两个阶段。prefill是计算密集的,用AWS的Trainium;decode是内存带宽密集的,用Cerebras的CS-3。

如今的OpenAI就是在两条腿走路,从硬件方面先压推理成本,然后再从软件方面压。

成本悖论:为什么优化了成本,HBM需求反而不会下降?

这里有一个反直觉的逻辑。

当KV cache压缩、分页、量化这些技术足够成熟,单个请求需要的HBM容量肯定会下降。尤其对推理集群来说,HBM容量和带宽的利用效率会系统性提升。

但是你反过来去想,一旦推理的成本降下来了,模型厂商马上会把省出来的显存拿去做更长上下文、更高并发、更复杂agent。

以前8K上下文贵,那就少给;现在KV cache优化了,就推128K、1M上下文。以前agent跑10步嫌贵,现在就让它跑50步、100步。以前一个用户占一份缓存,现在要同时服务更多用户。

单个请求占用的HBM可能下降,但总的HBM需求未必下降。

还有一个点,HBM不只是装KV cache,它还要装模型权重、激活值、中间计算结果,也决定数据喂给GPU计算单元的速度。

就算KV cache被优化了,HBM容量和带宽仍然是核心瓶颈。

OpenAI想上市就必须降低推理成本

奥特曼口口声声说不着急上市,并且外媒也表示,受SpaceX上市后股价不稳的影响,OpenAI倾向于推迟到2027年再上市。

但财务数据不会说谎。

2025年全年收入130.7亿,总成本和费用340亿,运营亏损209亿。光付给微软的云计算账单就超过172亿。

2026年预计烧在推理和训练方面141亿。唯一的好消息是毛利率提高了,2026年Q1,OpenAI的API业务毛利率达到了39%,目标是年底冲到52%。

不过这只是皮毛而已,大家心里都清楚,再不控制成本,OpenAI可能就再也控制不住成本了。

对行业的三个判断

1. 推理成本优化将成为AI公司的核心竞争力

过去几年,行业的竞争焦点是模型能力——谁的参数更大、谁的上下文更长、谁的推理更强。

但从OpenAI的动作来看,下一阶段的竞争焦点将是推理成本。

谁能用更少的GPU、更低的HBM占用、更少的能耗,跑出同样甚至更好的效果,谁就能在商业化上活下来。

这不是技术问题,是生存问题。

2. 软硬件协同将成为标配

OpenAI的Jalapeño芯片和Cerebras合作,释放了一个明确的信号:未来的AI公司,不能只做软件,必须深入硬件。

用AI设计AI的芯片,然后AI芯片再去跑AI模型。这个闭环一旦形成,英伟达的通用GPU方案可能会面临挑战。

当然,这不是说英伟达会倒下,而是说推理市场的格局会发生变化。训练可能还是英伟达的天下,但推理,会有更多玩家入场。

3. 成本优化不会减少总需求,反而会创造新需求

这是一个经典的”杰文斯悖论”:当某种资源的利用效率提高,人们不会减少使用,反而会增加使用。

KV cache优化了,模型厂商不会说”太好了,我们可以少用点HBM了”,而是会说”太好了,我们可以推更长的上下文、更高的并发、更复杂的agent了”。

成本下降不会减少需求,反而会释放被压抑的需求。

这对整个行业来说是好事。推理成本降下来,更多应用场景会变得可行,AI的普及速度会加快。

写在最后

OpenAI年亏209亿,这个数字看起来很吓人,但更吓人的是,OpenAI可能还没找到真正的成本控制方法。

KV cache优化、Jalapeño芯片、Cerebras合作,这些都是尝试,但能不能真的把成本压下来,还要看实际效果。

不过有一点是确定的:推理成本,已经成为AI公司的生死线。

谁能把推理成本压下来,谁就能活到下一个阶段。谁压不下来,谁就会被成本拖死。

摸着DeepSeek过河,OpenAI正在走一条中国公司先走过的路。

这不丢人。在生存面前,面子不重要。

重要的是,能不能活下来。

发表回复

Your email address will not be published. Required fields are marked *.

*
*