别再给大模型送冤枉钱了:Anthropic 官方下场教省钱,暴露了 AI Coding 的真正分水岭

别再给大模型送冤枉钱了:Anthropic 官方下场教省钱,暴露了 AI Coding 的真正分水岭

过去一年,不少用 Claude Code、Cursor 的开发者都有过同一种肉痛体验:明明只修了一个小 bug,一查账单,几十美元的 Token 莫名其妙就蒸发了。

就在刚刚,Anthropic 官方终于看不下去了,亲自发文《Maximizing the value of your Claude Code sessions》,教全球程序员如何在 Claude Code 里“极限省钱”。

官方这波虽然看似在“自断财路”,但字里行间却扒出了大模型编程工具在工程落地上的残酷真相:同样的 bug,懂 Token 机制的人花 3 美元搞定,不懂的人花 30 美元还在原地打转。

在 AI 编码时代,写 Prompt 早已过时,掌握“Token 经济学”与上下文管理,成了工程师最硬核的基本功。

为什么你的 Token 总是以 $O(n^2)$ 级暴增?

要省钱,首先得搞清楚 Anthropic 是怎么从你兜里掏钱的。

每次你在 Agent 里按次回车,底层都经历两个阶段: 1. 预填充(Prefill):模型一口气读入系统提示词、`CLAUDE.md`、会话历史与当前输入。这是并行运算,价格相对便宜; 2. 解码(Decode):模型一个字一个字向外输出思考与代码。这是串行运算,每吐一个 Token 都要跑一次全模型计算,因此输出 Token 的单价是输入的整整 5 倍

更致命的陷阱在于上下文的滚雪球效应

对话每推进一轮,模型读过的文件内容、终端跑过的测试日志,全部会被追加到历史记录中。到了第 40 轮,模型为了回复一句话,必须把前 39 轮所有看过的几万行代码从头到尾重读一遍——这种输入开销的增长,是赤裸裸的 $O(n^2)$ 平方级膨胀

如果中途某个测试框架吐了 400 行废话日志(不到 30000 字符的截断阈值),这 400 行脏数据就会像寄生虫一样钉在每一轮请求里,反复吃你的 Token。

官方教你薅羊毛:保住 0.1 倍的“提示缓存(Prompt Cache)”

面对平方级膨胀,Anthropic 官方给出的终极解药是:提示缓存(Prompt Caching)

如果本次请求的前缀与上次完全一致,服务器直接加载内存结果,读取费用只要正常价格的 0.1 倍(直接立减 90%)

但缓存是个极其娇贵的“单向链表”,只要前缀中任何一个字节发生变动,后面的缓存全部报废。官方列出了最容易踩雷的六大“缓存杀手”:

中途切模型(`/model`):从 Sonnet 切到 Opus,所有积累的缓存瞬间清零,整段历史按全价重新预填充; – 中途切推理强度(`/effort`):思考档位也是 cache key 的一部分,来回切换等于白送全价; – 进出 `opusplan` 模式:每次进出计划模式都会自动切换模型,来回跳跃一次就多收一笔全价 prefill; – 错峰压缩(`/compact`):千万别在刚开工缓存正热的时候做压缩,等到准备休息、缓存即将超时(API 默认保活 5 分钟)时再跑压缩,成本立减 90%。

此外,官方推荐的 Subagent(子智能体)隔离术 更是工业级实操的标配:遇到“翻日志、搜大文件”这种脏活,单独扔给子 Agent 跑,跑完只把 3 句话的结论传回主会话,把成千上万行中间输出彻底丢弃在独立沙箱里,绝不污染主干上下文。

Kate 的观点与判断

看完 Anthropic 这份官方指南,我给所有使用 AI Coding 的团队提三点忠告:

1. 别把 Agent 当全知全能的搜索引擎。用 `@` 精准指定文件路径,在 `CLAUDE.md` 里给测试命令加上静默参数(`–reporter=dot`)。少让 AI 执行一次全局 `grep`,你的会话就能多活 20 轮。 2. “随手 `/clear`”是 AI 时代最好的工程习惯。改完一个需求立刻 `/clear` 开启新会话。把上一个任务的遗留状态带进下一个任务,不仅浪费钱,还会诱发灾难性的注意力漂移与代码幻觉。 3. 工程师的核心竞争力正在向“上下文驾驭力”迁移。一年以前我们比拼谁的代码写得快,今天我们比拼谁能用最小的 Token 预算、在最干净的上下文里驾驭模型把活干完。知道何时用 Sonnet、何时上 Opus、如何保住 Cache 的工程师,才是企业真正抢着要的生产力黑客。

大模型的降价是巨头的施舍,但真正的降本增效,永远掌握在懂架构、懂机制的工程师自己手里。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注