降价50%背刺旗舰:Gemini 3.7 Flash 疯狂提速,但谷歌的“Pro”去哪了?
降价50%背刺旗舰:Gemini 3.7 Flash 疯狂提速,但谷歌的“Pro”去哪了?
距离 3.6 Flash 发布仅仅三周,谷歌就迫不及待地把 Gemini 3.7 Flash 拍在了桌上。
更狠的是,这是哈萨比斯交棒 Koray 后,谷歌新掌门人烧出的第一把火:价格直接腰斩(输入每百万 Token 0.75 美元、输出 3.75 美元),同时在代码、长程任务和 Agent 工作流评测上大幅暴涨,DeepSWE 提分 18.8%,WebDev Arena 飙至 1588 分。
但所有开发者在狂欢之余,心里都在犯同一个嘀咕:三个月内 3.5 Flash、3.6 Flash、3.7 Flash 连轴转,原本代表大模型智力天花板的 Gemini 3.5 Pro,怎么彻底哑火了?
当最轻量的 Flash 跑得比谁都快、甚至开始接管原本属于 Pro 的复杂长任务时,大模型厂商之间的竞争逻辑正在发生剧烈畸变。
从“比拼谁更聪明”到“比拼谁先把活干完”
过去,小模型(Flash / Mini)的定位很明确:便宜、快速、处理日常聊天或单步抽取,复杂推理和多步规划必须留给高昂的 Pro / Ultra 模型。
但 Gemini 3.7 Flash 的演进,彻底打破了这种阶级划分。谷歌官方直接给它的定位定性为:“迄今为止最智能的编码和 Agent 主力模型”。
这体现在几个核心变化上:
1. 从单步生成到整条长任务链:在 FrontierCode(43.6%)和 DeepSWE(65.3%)上,新 Flash 不再追求瞬间吐出一小段代码,而是能够稳定跑通包含多轮调用、测试和报错回滚的长链条任务。 2. 主动确认与分支切换:在模拟企业真实工作流的 AutomationBench 上,3.7 Flash 得分直接从 17.0% 翻倍至 30.4%。它学会了在需求模糊时先暂停向用户确认,在工具报错时主动切换执行分支,而不是死磕一条路直到上下文爆炸。 3. 推理成本的断崖式碾压:在官方构建的 3-Agent 机器人自主控制实测中,3.7 Flash 相比 Groq / Grok 4.6 方案,不仅建模质量更高,推理耗时缩短到十分之一,API 成本更是从 11.22 美元直接打到了 1.46 美元。
以前的 Flash 追求的是“快点回话”,现在的 Flash 追求的是“把手头的脏活累活闭环干完”。
Pro 难产背后的隐秘拉锯:弃车保帅还是大厂内耗?
一边是 Flash 疯狂迭代,另一边是 Pro 系列自 3.1 之后陷入诡异的停滞。
这反映了谷歌内部在技术路线与商业战略上的激烈博弈:
– 哈萨比斯派系:追求纯粹的 Scaling Law 与前沿科研,试图打造真正跨越维度的旗舰底座; – 产品工程派系(Koray):在被 OpenAI、Anthropic 以及开源 DeepSeek 的轮番围攻下,大厂需要立刻拿得出能服务数亿用户、成本可控、能直接装进 Pixel 和云服务的赚钱工具。
当旗舰 Pro 模型在庞大算力消耗下遇到了边际效益递减(性价比无法平衡),猛推高智效、低延迟、可大批量部署的 Flash 模型,就成了谷歌最理性的“弃车保帅”。
更残酷的是:如果一个 0.75 美元的 Flash 已经能解决企业 90% 的 Agent 编码与自动化需求,谁还会愿意为动辄贵 10 倍、响应慢 5 倍的 Pro 账单买单?
Kate 的观点与判断
面对 Gemini 3.7 Flash 的降价突击与行业变局,我有三个明确的判断:
1. “小模型吃掉大模型”已成定局。大模型的能力正在被迅速压缩进更小、更密集的架构中。未来 80% 的生产级 Agent 系统将全面基于 Flash / Mini 级别的高智效模型构建,顶尖旗舰模型将退守至极少数前沿科学发现与合成数据生成领域。 2. 限时降价是残酷的生态圈地战。谷歌将半价活动定在年底前,摆明了要在下半年用极致性价比把开发者从 Cursor、Claude Code 和各类开源生态中拉回 Google Cloud。价格战已经进入白刃战,没有自研芯片和巨额算力底座的腰部厂商将极难生存。 3. 开发者应立刻重构你的 Agent 成本模型。不要再无脑把所有任务都丢给最贵的模型了。在工作流前端使用 3.7 Flash 进行多 Agent 任务拆解与代码编写,只在关键决策点保留高阶校验,你的 Token 账单至少能缩减 70% 以上。
模型不需要天天吹 AGI 奇点,能把生产环境的 Token 成本打下来、把长任务老老实实跑通,才是真正的生产力革命。