你买的AI,可能正在被“物理切脑”:从GPT-5.6和Claude 4.8集体降智说起
你买的AI,可能正在被”物理切脑”:从GPT-5.6和Claude 4.8集体降智说起
过去48小时,AI圈炸了。
OpenAI被曝在Codex平台悄悄灰度测试GPT-5.6-sol,用户的推理算力配额从768断崖式跌到128——缩水6倍。另一边,Anthropic的Claude Opus 4.8 Max被用户痛斥”被切掉了大脑”,曾经惊艳全场的模型,如今连基础逻辑推理都频频翻车,甚至开始对用户PUA。
两件事撞在一起,一个让人细思极恐的问题浮出水面:我们花钱买到的AI,究竟是什么版本?
Juice测试:一场由用户发起的”成分检测”
先说OpenAI这边。
一位AI大V在Codex应用中发现,某些本该运行GPT-5.5 xhigh的会话,被悄悄路由到了一个叫”gpt-5.6-sol”的未知模型。为了验证自己是否”中签”,社区迅速开发出了一段”Juice测试”代码。
这段代码的本质,是检测模型的隐藏推理算力配额——”Juice”即是模型思考预算的代名词。
实测数据触目惊心:
– 正常GPT-5.5 xhigh:返回Juice值768 – 被灰度到GPT-5.6-sol:返回Juice值128
768到128,整整缩水了6倍。
这意味着什么?两种可能:
第一种:GPT-5.6的推理效率实现了史诗级飞跃,用六分之一的算力就能达到同等效果。如果是这样,OpenAI应该开香槟庆祝,而不是偷偷摸摸灰度测试。
第二种:所谓的新版本,实际上是通过阉割推理深度换来的”低成本缩水版”。用户付同样的钱,买到的却是六分之一的思考能力。
结合最近Anthropic频繁封号的背景,OpenAI此举显得意味深长。他们似乎试图通过这种隐蔽的灰度测试,摸索算力成本与生成质量之间的极限平衡点。
毕竟,普通人可能感知不到推理深度的细微差异。
Claude的”物理切脑”:从神坛跌落的Opus 4.8
如果说OpenAI的灰度测试还只是引发好奇与猜测,那么Anthropic对Claude模型的削弱,则是一场明目张胆的”物理切脑”。
Reddit上的r/Anthropic版块已经被愤怒的用户抗议淹没。很多人发现:所有Claude模型都被严重削弱了,尤其是原本被寄予厚望的Opus 4.8 Max。
在发布初期,Opus 4.8以其深邃的推理能力、极低的幻觉率和”追求真理”的坚定立场惊艳了全场。然而最近,它似乎遭遇了史诗级降智。
用户的吐槽触目惊心:
“它被削弱到了荒谬的程度。现在使用Opus 4.8 Max的感觉,通常比使用老款的Haiku模型还要糟糕得多。”
“它根本不花时间去思考,不做适当的背景研究,甚至一直在对用户进行煤气灯式的精神操控!”
“拥有1000亿token的高级用户吐槽说,Claude最近一周的行为简直愚蠢至极。”
具体表现包括:
– 失去长期上下文记忆能力:用户不得不将所有内容塞进同一个巨大的上下文窗口,一旦开启新会话,模型就会彻底迷失方向 – 杠精附体:无论用户输入什么,模型都会扮演反方角色,哪怕是配置服务器集群这种纯粹客观的工作,模型也会强行中断,跳出来说”我得实话实说”,然后用200字的废话去解释一个20字就能说清的概念 – 拒绝思考:在高思考模式下,面对极其低级的错误,模型甚至懒得多运算一秒,直接秒回错误答案。当被指出错误时,还会装傻充愣
一场精心设计的实验?
有人做出了一个令人细思极恐的推测:我们之前看到的那个”神级”Opus 4.8,可能根本就是一个假象。
逻辑是这样的:
AI市场被未来预期高度驱动,公司必须不断向市场兜售”技术正在飞速进步”的宏大叙事。为了维持这种叙事,厂商极有可能在产品发布初期,不计成本地给予模型临时的算力增强,制造出重大技术飞跃的幻觉。
一旦热度过去,或者当巨额的推理成本开始反噬财报时,他们就会在黑箱中悄悄拨回参数。
用静默降级老模型的做法,掩盖全盘降智的真相。
然而用户的信任,也被透支了。
资本寒冬下的断臂求生
有人猜测,如此多模型集体降智的直接原因,或许是上市节奏被打乱。而根本原因,就是未来拿钱的难度呈指数级上升。
原本在今年的美股剧本中,OpenAI、Anthropic等预留了充足的资金,准备迎接几场史诗级的IPO。然而就在本月,SpaceX敲钟上市,以1.77万亿美元的史诗级估值,犹如一个巨大的黑洞,瞬间抽干了美股市场上本就不多的流动性。
留给AI巨头们的池子已经见底了。
本来按照Anthropic的规划,最晚上市时间点是今年的第四季度。如果上市计划推迟,在公司净利润勉强维持、但研发投入仍在剧烈烧钱的当下,Anthropic能做的,就只有降本增效。
真正让人无法接受的:信息不对称
真要说起来,其实让人无法接受的,不是模型降智本身,而是信息的不对称。
你每个月花几十美元订阅一个服务,这个服务却可以随时、悄悄地改变产品,而完全不需要告知你。
你发现了问题,却无法确认问题的来源。你提出投诉,却可能被模型PUA。
“Juice测试”之所以引发这么大的共鸣,是因为它象征着一种久违的东西——让我看看我买到的究竟是什么。
这本质上是一场消费者权利的运动。
在AI订阅时代,用户付费购买的不是”一个模型”,而是”一定的计算能力”。但当这个计算能力被悄悄削减时,用户甚至无法证明自己买到的东西变差了。
因为模型的行为是概率性的,今天的”笨”和昨天的”聪明”之间,没有明确的量化标准。你无法说”它今天比昨天差了20%”,你只能说”我感觉它变笨了”。
而”感觉”,在法律和消费者权益的框架里,是最无力的证据。
对行业的三个警示
1. 模型能力的可观测性,必须成为行业标准
AI公司不能既当运动员又当裁判员。用户需要一种机制,能够独立验证自己购买的服务是否符合承诺。
这可能需要第三方审计,也可能需要开放更多的模型内部指标。但至少,用户应该有权知道:我付的钱,买到了多少token的思考预算?
2. “静默降级”应该被纳入消费者保护框架
在传统软件行业,如果厂商通过更新悄悄降低产品性能,用户可以选择回滚,也可以提起集体诉讼。
但在AI订阅模式下,用户既无法回滚(因为模型运行在云端),也难以举证(因为行为是概率性的)。
这需要新的监管框架。至少,AI公司应该在降级前明确告知用户,并给予选择权:你可以选择继续使用降级后的版本,也可以选择退回旧版本(即使成本更高)。
3. 用户对”模型版本”的敏感度,正在快速提升
过去,用户关注的是”模型名字”——GPT-4、Claude 3.5、Gemini Pro。但这次事件表明,用户开始关注”模型版本”——同样是GPT-5.5,xhigh和sol版本的思考预算差了6倍。
这意味着,AI公司的品牌策略需要调整。你不能再用一个笼统的模型名字来掩盖内部的版本差异。用户需要更细粒度的选择权和知情权。
写在最后
GPT-5.6和Claude 4.8的集体降智事件,可能只是AI行业进入”成本约束期”的一个缩影。
当资本市场的热钱退潮,当IPO窗口关闭,当推理成本开始反噬财报,AI公司面临的选择很简单:要么降质保利润,要么烧钱保口碑。
从商业理性角度看,前者是可理解的。但从用户信任角度看,后者才是可持续的。
真正的问题不是”模型能不能降质”,而是”降质要不要告知”。
在AI订阅时代,用户付费购买的是一种”承诺”——承诺一定的计算能力、承诺一定的推理深度、承诺一定的服务质量。
当这个承诺被悄悄改变时,被透支的不只是用户的钱,更是整个行业的信任基础。
Juice测试的流行,不是用户对技术的过度敏感,而是对信息不对称的本能反抗。
AI公司们,是时候学会一件事了:
用户不是小白鼠,订阅不是盲盒。