花最贵的钱买最懒的AI:Model和Effort的区别,正在吃掉你80%的token账单

花最贵的钱买最懒的AI:Model和Effort的区别,正在吃掉你80%的token账单

你有没有过这种经历?

Claude Code干到一半撂挑子了,该读的文件不读,该跑的测试不跑,反过来问你「能给我更多上下文吗」。

你的第一反应是什么?——「肯定是我选错模型了?,换成更贵的Fable。

结果账单暴涨,问题却一样。

因为你一直在花最贵的钱,买最懒的AI。

Cl简单粗暴”变笨”事件:6852个会话的愤怒

今年3月,Claude Code社区突然炸锅。

大面积用户反馈:手里的Claude”变笨了”。该读的文件直接跳过,测试一个都不跑,任务干到一半就开始往回推,话术统一——”能给我更多信息吗?”

GitHub上骂声一片。最狠的一刀来自AMD的AI负责人Stella Laurenzo。

这人没骂,是直接上数据:翻了6852个会话日志,发现Claude思考量比2月之前掉了67%。

67%!

什么概念?就是你花着同样的钱,请了个同一个人,干的活直接缩水了三分之二。

“Claude已经没法被信任,去干复杂的工程活了。”——Stella的原话。

所有人都在猜是不是模型被降级了、服务器被限流了、Anthropic在搞什么小动作。

折腾了一个多月,答案揭开:3月4日,Anthropic悄悄做了一件事——把Claude Code里的Effort默认档位从high降到了medium。

就为了压低延迟。一句话:为了让你省几秒的等待时间,让AI直接少干了67%的工作。

这场风波4月7日随着默认恢复才平息。但大多数人这时候才意识到——原来根本问题不在模型,在他们手里那个Effort旋钮。

官方揭秘:Model和Effort,是两个世界

一个月后的今天,Anthropic亲自下场,发了一篇长文把这件事彻底讲明白。

核心就一句话:

Model换的是”脑子”,Effort换的是”态度”。

Model:你买的是”会不会”

每个模型背后是一套冻结的权重,它的能力在训练结束那一刻就被焊死了:只读、不可写。

给它喂提示词、喂CLAUDE.md、贴上下文代码——你能引导它,但训练不了它。

这里面的逻辑你必须想通:

– 一个在模型训练时还不存在的库,你把整篇文档喂给它,它能现学 ——**但只学不会自己记住它,下次该喂还得喂。 – 它一本正经调用不存在的API ——不是疏忽,是权重里的老套路在硬拼。 – 你换模型,换的是一整套权重分配的根本能力。 这一步解决的是”会不会”:这个活,这个模型有没有本事干。

Effort:你买的是”干不干”

很多人以为高Effort就是”多想几秒”——错。

回到不:

– 它管的是Claude在这次任务上到底投入多少工作量。** – 它决定读几个文件、跑不跑测试、要不要额外验证。 – 它决定一个多步骤任务,是一口气推到底还是干了一半就回来烦你。**

前面那个训斥:

> **低Effort的Claude, > > 高Effort的Claude,倾向于自己去翻信息、多调工具、一口气把长任务链跑完。

低Effort和高Effort对着同一条同样的prompt,你能看到的多了7倍的token消耗,全用在真正干实事儿,读文件、跑验证、反复确认。

**这不是延迟换来的,是工作量换来的。

重点来了:

不会,还是不够努力

官方给了一个实际偏差:Claude干砸了,先别急着换模型。

第一步永远是回头检查上下文:prompt说清楚了吗?工具给全了吗?CLAUDE.md配对了吗?大多数错不在模型,就在这一步。

上下文确认了,还是错了——问自己这句话:它是不会,还是不够努力?

不够努力的表现很明显:

– 该跳过的文件直接跳过,测试一个不跑,检查不查 – 重构到一半,跑回来问你想怎么办,就差告诉你”帮我写个请给我更多的上下文” – **聪明显示:明显在兜圈子,在数据库结合上下文时明明有答案。但这种AI叫就提醒你这个AI专家。

态度决定一切,认死了这个误区的人,就是Sam Altman。

三种模型的真相:你不是花钱请更强的师傅,你是花钱雇人用对了时间

官方用了三个比喻,我的理解直接对应成你的开发团队的几种人:

Sonnet = 有一整个下午的全能选手

时间多,精力足。它会从头把代码看到尾,跑一遍、再验一遍,最后真把你这摊活儿吃透了。

适合活:大到内循环功能重构、日常维护、一次性独立功能。

用招性:开高Engagement,给它足够时间”

Opus = 只有5分钟的专家

它不去把所有文件走了个遍。但五年内,它从来没见过的坑、该绕的雷,全是解决一堆问题积累的直觉。

适合活:那处所有人都看不出、超过5分钟排雷布正。

Opus的错误大,但时间不够。

Fable = 那个你请不起、但所有人卡住了才能请动的专科医生

所有人看计算、所有人都卡住了、请您出动,它哪怕只给5分钟,该拿出来的职业.

适合活:系统级推断瓶颈、工程判断点、无人接手的硬骨头。

大招:极高Engagement,请它all in。

最值得重视的决策点:一个小模型全火力输出,可能比大模型出工不出力强得多。

精细化派出任务,小成本开最大努力度。它们干翻你手上任何大模型低反。

换句话说:

你买的从来不是更强的模型,你是在买合适的脑子+配对的行动力。

这就是官网那个反常识策略:”就算你手里握的是”大模型全快输出也不如小模型全快输出”。最亏钱的模式:你买了最高级的刀,冲在最猛的求上,然后刻死了最慢、最省力的格。你花了大师的钱,雇了个磨洋工。记住这两个支配铁原则:

– 用这把配置菜单,是设置键值对的基本能力,永远不会随模型变化而变化。关了这个就是关键。它可以随时启动关键路径,决定创业成败。 – 记住那把设置键>什么[Level]菜单,而不是整条路径中复杂度或执行努力度选项的简化。每次设置都考验你的全局配置观。 总是在”模型选项”试图找高匹配答案的人,本身就是一种设置错误,而非模型缺失。

但等等——这个开关本来就不该被藏起来

现在我认真说,这个问题的核心不是用户会误选设置,而是整个设计机制本身。

Anthropic把这个Effort选项设计在用户菜单里,默认档次一改,全网集体”降智”的恐慌发酵了一个月。

这说明什么?

– 绝大多数人是分不清”模型能力”和”努力程度”的差额的。 – 默认low是把社区用户当小白鼠,震怒后改回来,这调整的依据是数据报告,不是提前的思考。

换句话说,产品开发方最清楚:底层原理他们懂,但实际使用时,所有人都靠”感知”而非”搜索”。Ephemeral那个延迟,没人会关心背后的反思。

这意味着,无论模型多强,如果执行意愿可以被轻易调小,AI的交付质量就无法被全局保障。

说到底,Claude Code的这件事,揭示的是所有AI应用的通病:模型能力进步了,工程上的使用断层出现了。你以为花更多token买了个更聪明的 assistant,实际上你买的只是更多的推理时间——这个时间的质量,完全取决于你能否设置好”执行意志”。

如何把账单花在刀刃上:我的派活指南

直接给出一套可用策略:

什么场景换模型?

– 当你给了足够的上下文、最高的Effort,Claude还是出错时——这是”不会”,换更强的模型。 – 新场景、跨框架迁移、涉及新技术栈时 — 已有的训练权重可能没覆盖。 – 长尾问题、系统性问题,需要一个极其资深的专家。

什么时候调Engagement?

– 当你发现Claude在兜圈、跳过文件、不做验证时——这是”不够努力”,往上加Effort档位。 – 重构不差时,先开最高档让Claude全部确认;散活时,中档快速完成即可。 – 让Claude Code在关键路径上的farm/fleet任务,必须满attitude。

具体场景匹配(压箱底经验):

| 场景层次 | 推荐组合 | 为什么 | |———|———|——-| | 简单调整/fix | Sonnent + Low Effor | 快、便宜、够用,秒杀常规 | | 大型重构 | Sonnent + High Effor | 最性价比,需要大量时间遍历和验证 | | 复杂/疑难工程 | Fable + High/Ultimate | 它可能需要的资源量惊人,但解决率更高 | | 系统级/架构风险 | Opus + High Effor | 专家直觉先定位,高努力让验证充分 | | 长期自主运行/Agent | Fable + UltraCode | 能自动分配子任务,多单并跑 |

核心心态:

> 你会负责安排好一个人——不是给最高时薪就完事了,是监督他责任制。

这一点上,不会选的人是分不清”人不会”还是”人不努力”。

终局判断:从”谁的模型强”到”谁的调度强”

整场事件,不管是3月风波还是今天的官方揭秘,其实透露了一个行业转向:

AI编程的竞争,从”谁的模型强”进入”谁的调度强”。

以前很简单:选一个最上面放一个最强的模型,剩下的全端上去。

现在不行了。你得像个CTO一样,给不同能力的人分配不同的时间预算——看速度换功能、想省钱换成本、要质量换Fable,公众常常只给个”不知道在哪”的输入。

这反人性吗?带着反差。一个永远告诉你”我可以做得更好,请给我更多时间”的人工智能,本质上就是一个完美的PTA(兼职助理)。你不明确给他指令,它就默认你自己承担。

简单来说,这两个选项的权力下放给了用户,根本不是在解决技术问题,而是在工程上设置挑战——能看穿AI”偷懒”的人才会用得更好。

所以:

– 爱思考的人会说:完善了真正的生产力,不再焦虑。 – 只会交线的人会说:而且他还是遵循着我的思路在做事,没有功劳。

恕我直言:真正的问题如此看待。在这个抛开年龄大、经验不足的时刻,决定谁输谁赢的关键,不是模型有多大,是你能否为你的席都没地支付的劳动力的市场价,把好钢用在刀刃上。

——

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注