1800亿美元资本开支逼出的“死磕”:谷歌“Frozen v2”要把大模型焊死在硅片里
1800亿美元资本开支逼出的“死磕”:谷歌“Frozen v2”要把大模型焊死在硅片里
据《The Information》爆料,谷歌正在秘密设计一款内部代号为 Frozen v2 的全新服务器芯片。
与目前行业通用的 TPU 或英伟达 GPU 不同,Frozen v2 的野心极其霸道——它准备把 Gemini 模型的一部分结构、参数信息以及特定计算模式,直接“硬焊”进硅片硬件里。
根据谷歌内部预期,如果这套方案成功落地,以每瓦能耗生成的 Token 数量衡量,其效率将达到谷歌最新自研芯片的 6 到 10 倍。
消息一出,Alphabet 股价在 7 月 20 日应声上涨 3.3%。
但在一片“芯片革命”的欢呼声中,我们需要看清这背后的真实商业逻辑:这根本不是什么优雅的技术突破,而是被每年近 2000 亿美元暴涨的资本开支(CapEx)逼出来的“破釜沉舟”。
—
逼近极限的物理法则:英伟达GPU模式的财务隐患
过去几年,整个 AI 行业的繁荣建立在一句口号上:Scaling Law(规模法则)。
算法不够?堆参数!模型不行?加算力!
然而,当大模型的应用从“尝鲜聊天”走向全网千万级并发的 Agent 部署时,巨头们突然踩中了一块无比坚硬的物理铁板:推理成本黑洞。
Alphabet 2026 年第一季度的财报指引将全年资本开支拉到了令人窒息的 1800 亿至 1900 亿美元——几乎是 2025 年(914亿美元)的两倍!即便强如谷歌,其 Google Cloud 甚至因为算力集群极端紧张而不得不婉拒部分外部客户的巨额订单。
通用 GPU(比如 H100/B200)为了照顾极高的通用性,绝大部分芯片面积和能耗都浪费在了数据搬运、控制逻辑以及未被充分利用的矩阵单元上。
当用户每次在搜索引擎或智能终端里触发一次复杂的 Agent 多轮调用时,后台消耗的每一度电、诞生的每一个 Token,都在吞噬公司的营业利润。
如果继续用通用芯片跑通用模型,AI 业务规模越大,巨头的现金流失血就越惨烈。
谷歌的算盘:用“牺牲通用性”换取“每瓦10倍Token”
面对这个财务死局,谷歌选择了一条极端的路线:从“通用计算”彻底倒退回“专用计算”。
这就是 Frozen v2 的本质——芯片不再回答“什么样的 AI 适合计算”,而是只回答“Gemini 到底该怎么计算”。
1. TPU 的开放双轨制:TPU 8t 和 TPU 8i 继续向外输出,支持 PyTorch、JAX 等主流软件栈,去赚外部企业和云客户的钱。 2. Frozen 的极度封闭化:它不需要兼容别的模型,不需要支持外部生态,它的唯一使命就是在谷歌私域数据中心里,以极致的能效比跑 Gemini。
只要把 Gemini 最核心、最不可能改动的注意力矩阵和参数结构映射到硬件上,就能省去数以亿计的 SRAM 寻址和 DRAM 数据搬运。
在数十亿用户每天触发的谷歌搜索、Workspace、YouTube 推荐和 AI 助手请求里,每一次 Token 生成节省的哪怕 0.001 美厘成本,乘以万亿级的日并发量,都是极其惊人的财务屏障。
这是只有谷歌、微软这种手握超级流量入口的巨人才能玩的“以量摊薄硬件研发”的终极游戏。
最大的毒药:软件迭代以月计,硬件迭代以年计
但把大模型固化进芯片,无异于一场高风险的豪赌。
芯片设计的物理周期以“年”计算:从架构设计、Tape-out 流片、台积电/三星 2nm 晶圆代工到最终的数据中心部署,Frozen v2 最快也要到 2028 年才能投产。
而大模型的进化周期是以“月”甚至“周”计算: – 2024 年大家还在卷 Dense 架构,2025 年瞬间全面转向 MoE(混合专家模型); – 昨天还在用传统的 Self-Attention,今天 DeepSeek 的 MLA(多头潜在注意力)和各种稀疏注意力机制就轰炸了整个行业。
如果到了 2028 年,Gemini 的底层算法架构发生了根本性变迁(例如全新的非 Transformer 架构或全新的动态路由算法),那么被提前“焊死”在 Frozen v2 硅片上的硬件电路,就会在瞬间变成昂贵且毫无用处的电子垃圾。
这也是为什么谷歌官方在面对 TechCrunch 的询问时显得极其克制,强调“并非每个研究项目最终都会投入生产”。
Kate 的判断:AI 芯片的竞争重点,已经彻底变了
Frozen v2 项目给所有创业者和技术决策者敲响了一个信号:
AI 芯片的上一阶段竞争,拼的是“绝对算力”(FLOPs 和带宽);而下一阶段的生死局,拼的是“商业能效比”(每瓦 Token 产出)。
随着大模型演进到 Agent 自动化时代,Token 不再是简单的文字输出,而是庞大智能体协同的燃料。谁能把 Token 的生产和推理成本降低一个数量级,谁就能在接下来的产品定价战中降维打击对手。
但这并不意味着普通企业应该效仿谷歌去搞“硬件定制”。
对于 99% 的公司而言,建立多模型动态路由网关(Model Routing)、精细化管理上下文与推理 Effort 档位,才是当下无需造芯片就能立刻见效的降本手段。
至于把大模型刻进芯片这盘大棋?让拥有 1800 亿美金预算的谷歌去替大家试错和踩雷就好。