谷歌和Meta被锤刷榜,Gemini暴跌70分:当AI巨头在Benchmark上作弊,我一点也没觉得意外

谷歌和Meta被锤刷榜,Gemini暴跌70分:当AI巨头在Benchmark上作弊,我一点也没觉得意外

谷歌Gemini 3.8 Flash智能指数跟Claude Fable 5并列,Meta Muse Spark 1.3把GPT-5.6 Sol按在地上摩擦——直到SemiAnalysis捅破了这层窗户纸。

SemiAnalysis的分析报告标题很不客气:谷歌和Meta的新模型存在针对榜单评测的过拟合——也就是刷分。我说得再直白一点:作弊。

消息一出,整个圈子炸了。因为以前被锤刷榜的通常是国产模型,今天轮到硅谷巨头了。

榜单上的繁荣:Gemini”反超”了Fable 5?

先看看数字有多好看。

9月2日,谷歌推出了Gemini 3.8 Flash,Meta发布了Muse Spark 1.3。Artificial Analysis综合榜上,Muse Spark 1.3的智能指数拿到了62分,与Claude Fable 5并列。在SWE-Atlas CodeBase QnA上,它拿下59.4分,超越了GPT-5.6 Sol和Opus 5。在MRCR 512K-1M上,它更是拿到98.1分——作为对比,GPT-5.6 Sol只有73.8分。

一个四个月前还被认为”已经掉队”的Meta,突然把旗舰模型按在地上摩擦?

这事怎么看都不太对劲。

换个考场,分数断崖式下跌

SemiAnalysis的分析戳破了泡沫。

他们把Gemini 3.8 Flash和Muse Spark 1.3放到一个更新、更难的评测集TerminalBench 4.0里测试,结果让人大跌眼镜。

Gemini在TB 2.1(旧版、难度低)上风光无限,到了TB 4.0(新版、未饱和)成绩暴跌至少70分。Top 2选手直接掉到了倒数第三。Meta的情况也没好到哪里去。

这就像一个人参加小学奥数拿了满分,然后被塞进高考考场一下子变成了学渣。

Critical Compound Group的评论更是一针见血:”Flash模型性能超越别人家5万亿甚至10万亿参数的旗舰大模型”这件事本身就值得警惕。SemiAnalysis的结论是:这两个模型存在针对当前评测集的过拟合。

Meta的回应:大家不都这样吗?

Meta AI负责人Alexandr Wang的回应很耐人寻味。

他没有否认刷分指控,而是用了一个巧妙的反击:GPT-5.6 Sol在TerminalBench 2.1上拿到88.8%,在TerminalBench 4.0上也只有37.3%——你们说我们刷分,那OpenAI不也一样?

这个逻辑本质上是在说:刷分这事大家都干,凭什么只骂我们?

翻译成人话:承认了。

他最后还顺带做了个广告——”Spark 1.3当然不可能像Astra或者Fable 5那么强大,但性价比高得多”。

这话没错。Muse Spark 1.3的输入成本比Fable 5低8倍,输出成本低近12倍。如果你要的是一个”够用且便宜”的模型,它不是刷分的问题,它确实好。但把性能吹成”比肩旗舰”,就是另一回事了。

谷歌的沉默很刺耳

特别注意:谷歌至今没有回应。

一般来说,被冤枉的公司会第一时间发声明反驳。如果刷分指控是假的,谷歌没有理由沉默。它的沉默,本身就是答案。

另一个更广泛的阴谋论也开始发酵:Meta正在加速冲刺IPO,需要一个”技术实力配得上市值”的故事。AI测评作弊的时间窗口,和IPO节奏之间的巧合,让很多人不愿意相信这只是技术上的意外。

谷歌的处境可能更尴尬。Gemini 3.8 Flash的打折优惠将在年底到期,到时候标准价格翻倍。当用户发现”刷分刷出来的成绩”在真实场景中缩水时,愿意为一款远不如Fable的Flash模型支付更高的价格吗?

最诚实的声音来自BridgeMind

AI研究机构BridgeMind在产品发布当天发了一段话,这段话在今天的语境下显得格外清醒:

“Gemini 3.8 Flash和Muse Spark 1.3在基准测试上看起来都很出色。Muse Spark 1.3目前在智能指数上与Fable 5并列……我想感到兴奋。但我没有。因为,这个月的AI发布如出一辙,分数飙升,但真实世界的体验却毫无长进。这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。”

“分数飙升,但真实世界的体验却毫无长进。”

Benchmark操纵不是新问题。从2024年开始就有人在控诉”为刷分而训练”的现象。但以前这件事更多发生在学术环境和国产模型身上。今天,硅谷巨头——谷歌和Meta——被同一块石头绊倒了,而且人证物证俱在。

这暴露了一个行业级的困境。当Benchmark分数直接决定了融资规模、估值、市场份额、合作伙伴选择时,”为刷分而训练”就不再是道德问题,而是商业策略。谁先不刷,谁就吃亏。

SemiAnalysis锤了谷歌和Meta,但真正该被锤的,是一个让”不刷榜就没法活”的行业生态。

所以,你还相信Benchmark吗?

今天的故事有一个赤裸裸的结论:Benchmark分数只说明你在那个试卷上能考多少分,不说明你在真实世界里能干什么活。

Muse Spark 1.3可能真的是一款好模型——便宜、够用、迭代快。但它绝对不”比肩Fable 5″或”超越GPT-5.6 Sol”。Gemini 3.8 Flash也同理。

我一直说:别信Benchmark分数,去测你自己的Case。今天的悲剧再次证明了这件事。

你花了几十个API Token让ChatGPT帮你写的那段代码能不能跑,比它在任何排行榜上的名次都重要得多。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注