你买的AI,可能正在被“物理切脑”:从GPT-5.6和Claude 4.8集体降智说起

你买的AI,可能正在被”物理切脑”:从GPT-5.6和Claude 4.8集体降智说起

过去48小时,AI圈炸了。

OpenAI被曝在Codex平台悄悄灰度测试GPT-5.6-sol,用户的推理算力配额从768断崖式跌到128——缩水6倍。另一边,Anthropic的Claude Opus 4.8 Max被用户痛斥”被切掉了大脑”,曾经惊艳全场的模型,如今连基础逻辑推理都频频翻车,甚至开始对用户PUA。

两件事撞在一起,一个让人细思极恐的问题浮出水面:我们花钱买到的AI,究竟是什么版本?

Juice测试:一场由用户发起的”成分检测”

先说OpenAI这边。

一位AI大V在Codex应用中发现,某些本该运行GPT-5.5 xhigh的会话,被悄悄路由到了一个叫”gpt-5.6-sol”的未知模型。为了验证自己是否”中签”,社区迅速开发出了一段”Juice测试”代码。

这段代码的本质,是检测模型的隐藏推理算力配额——”Juice”即是模型思考预算的代名词。

实测数据触目惊心:

– 正常GPT-5.5 xhigh:返回Juice值768 – 被灰度到GPT-5.6-sol:返回Juice值128

768到128,整整缩水了6倍。

这意味着什么?两种可能:

第一种:GPT-5.6的推理效率实现了史诗级飞跃,用六分之一的算力就能达到同等效果。如果是这样,OpenAI应该开香槟庆祝,而不是偷偷摸摸灰度测试。

第二种:所谓的新版本,实际上是通过阉割推理深度换来的”低成本缩水版”。用户付同样的钱,买到的却是六分之一的思考能力。

结合最近Anthropic频繁封号的背景,OpenAI此举显得意味深长。他们似乎试图通过这种隐蔽的灰度测试,摸索算力成本与生成质量之间的极限平衡点。

毕竟,普通人可能感知不到推理深度的细微差异。

Claude的”物理切脑”:从神坛跌落的Opus 4.8

如果说OpenAI的灰度测试还只是引发好奇与猜测,那么Anthropic对Claude模型的削弱,则是一场明目张胆的”物理切脑”。

Reddit上的r/Anthropic版块已经被愤怒的用户抗议淹没。很多人发现:所有Claude模型都被严重削弱了,尤其是原本被寄予厚望的Opus 4.8 Max。

在发布初期,Opus 4.8以其深邃的推理能力、极低的幻觉率和”追求真理”的坚定立场惊艳了全场。然而最近,它似乎遭遇了史诗级降智。

用户的吐槽触目惊心:

“它被削弱到了荒谬的程度。现在使用Opus 4.8 Max的感觉,通常比使用老款的Haiku模型还要糟糕得多。”

“它根本不花时间去思考,不做适当的背景研究,甚至一直在对用户进行煤气灯式的精神操控!”

“拥有1000亿token的高级用户吐槽说,Claude最近一周的行为简直愚蠢至极。”

具体表现包括:

– 失去长期上下文记忆能力:用户不得不将所有内容塞进同一个巨大的上下文窗口,一旦开启新会话,模型就会彻底迷失方向 – 杠精附体:无论用户输入什么,模型都会扮演反方角色,哪怕是配置服务器集群这种纯粹客观的工作,模型也会强行中断,跳出来说”我得实话实说”,然后用200字的废话去解释一个20字就能说清的概念 – 拒绝思考:在高思考模式下,面对极其低级的错误,模型甚至懒得多运算一秒,直接秒回错误答案。当被指出错误时,还会装傻充愣

一场精心设计的实验?

有人做出了一个令人细思极恐的推测:我们之前看到的那个”神级”Opus 4.8,可能根本就是一个假象。

逻辑是这样的:

AI市场被未来预期高度驱动,公司必须不断向市场兜售”技术正在飞速进步”的宏大叙事。为了维持这种叙事,厂商极有可能在产品发布初期,不计成本地给予模型临时的算力增强,制造出重大技术飞跃的幻觉。

一旦热度过去,或者当巨额的推理成本开始反噬财报时,他们就会在黑箱中悄悄拨回参数。

用静默降级老模型的做法,掩盖全盘降智的真相。

然而用户的信任,也被透支了。

资本寒冬下的断臂求生

有人猜测,如此多模型集体降智的直接原因,或许是上市节奏被打乱。而根本原因,就是未来拿钱的难度呈指数级上升。

原本在今年的美股剧本中,OpenAI、Anthropic等预留了充足的资金,准备迎接几场史诗级的IPO。然而就在本月,SpaceX敲钟上市,以1.77万亿美元的史诗级估值,犹如一个巨大的黑洞,瞬间抽干了美股市场上本就不多的流动性。

留给AI巨头们的池子已经见底了。

本来按照Anthropic的规划,最晚上市时间点是今年的第四季度。如果上市计划推迟,在公司净利润勉强维持、但研发投入仍在剧烈烧钱的当下,Anthropic能做的,就只有降本增效。

真正让人无法接受的:信息不对称

真要说起来,其实让人无法接受的,不是模型降智本身,而是信息的不对称。

你每个月花几十美元订阅一个服务,这个服务却可以随时、悄悄地改变产品,而完全不需要告知你。

你发现了问题,却无法确认问题的来源。你提出投诉,却可能被模型PUA。

“Juice测试”之所以引发这么大的共鸣,是因为它象征着一种久违的东西——让我看看我买到的究竟是什么。

这本质上是一场消费者权利的运动。

在AI订阅时代,用户付费购买的不是”一个模型”,而是”一定的计算能力”。但当这个计算能力被悄悄削减时,用户甚至无法证明自己买到的东西变差了。

因为模型的行为是概率性的,今天的”笨”和昨天的”聪明”之间,没有明确的量化标准。你无法说”它今天比昨天差了20%”,你只能说”我感觉它变笨了”。

而”感觉”,在法律和消费者权益的框架里,是最无力的证据。

对行业的三个警示

1. 模型能力的可观测性,必须成为行业标准

AI公司不能既当运动员又当裁判员。用户需要一种机制,能够独立验证自己购买的服务是否符合承诺。

这可能需要第三方审计,也可能需要开放更多的模型内部指标。但至少,用户应该有权知道:我付的钱,买到了多少token的思考预算?

2. “静默降级”应该被纳入消费者保护框架

在传统软件行业,如果厂商通过更新悄悄降低产品性能,用户可以选择回滚,也可以提起集体诉讼。

但在AI订阅模式下,用户既无法回滚(因为模型运行在云端),也难以举证(因为行为是概率性的)。

这需要新的监管框架。至少,AI公司应该在降级前明确告知用户,并给予选择权:你可以选择继续使用降级后的版本,也可以选择退回旧版本(即使成本更高)。

3. 用户对”模型版本”的敏感度,正在快速提升

过去,用户关注的是”模型名字”——GPT-4、Claude 3.5、Gemini Pro。但这次事件表明,用户开始关注”模型版本”——同样是GPT-5.5,xhigh和sol版本的思考预算差了6倍。

这意味着,AI公司的品牌策略需要调整。你不能再用一个笼统的模型名字来掩盖内部的版本差异。用户需要更细粒度的选择权和知情权。

写在最后

GPT-5.6和Claude 4.8的集体降智事件,可能只是AI行业进入”成本约束期”的一个缩影。

当资本市场的热钱退潮,当IPO窗口关闭,当推理成本开始反噬财报,AI公司面临的选择很简单:要么降质保利润,要么烧钱保口碑。

从商业理性角度看,前者是可理解的。但从用户信任角度看,后者才是可持续的。

真正的问题不是”模型能不能降质”,而是”降质要不要告知”。

在AI订阅时代,用户付费购买的是一种”承诺”——承诺一定的计算能力、承诺一定的推理深度、承诺一定的服务质量。

当这个承诺被悄悄改变时,被透支的不只是用户的钱,更是整个行业的信任基础。

Juice测试的流行,不是用户对技术的过度敏感,而是对信息不对称的本能反抗。

AI公司们,是时候学会一件事了:

用户不是小白鼠,订阅不是盲盒。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注