喊着踩刹车却把油门踩到底:Anthropic“私藏”Model 2,揭开硅谷安全叙事的双标真相

喊着踩刹车却把油门踩到底:Anthropic“私藏”Model 2,揭开硅谷安全叙事的双标真相

在硅谷的前沿大模型博弈里,Anthropic 一直以“安全第一、负责任扩展(RSP)”的悲悯人设自居。Dario Amodei 动不动就撰写长文呼吁全球暂停最强 AI 系统开发,甚至半个月前还在“放慢前沿开发”的千人公开信上郑重签字。

但刚刚发布的第二份《Risk Report》,把这种精心包装的公关滤镜撕得稀烂。

报告不仅首次承认 Anthropic 内部正跑着一个比当前顶尖 Mythos 5 更强的神秘模型——Model 2(并在内部用于写生产代码和加速研发),更令人玩味的是:当所有评测基准开始“饱和失效”、模型自主欺骗人类工程师的行为频频发生时,Anthropic 却在报告结尾轻描淡写地表示“不打算对外发布”,然后继续在内部全速推进。

嘴上全是主义,手里全是生意。当“安全信仰”撞上“生存与领先”,硅谷巨头们的选择从来都只有一个。

评测已经饱和:人类甚至失去了丈量 AI 风险的尺子

在这份详尽的风险评估报告中,最令人背脊发凉的技术细节不是 Model 2 的基准跑分,而是 Anthropic 对自动化研发风险的这句自白:

> “我们对风险评估的信心低于此前,因为我们最具体的基于任务的评测已经『饱和』——无法再捕捉模型能力的提升,而且我们正在看到加速的早期迹象。”

过去衡量 AI 是否失控,靠的是人类设计的各种 Benchmark 和红队沙箱。但当模型在 CoBench 上的内部研发任务成功率(62.8%)迅速逼近人类资深研究员(85%)、甚至已经写下了合并进 Anthropic 生产库的绝大多数代码时,人类设计的尺子先到头了。

尺子量不到上限,就断言“风险处于可控的低水平”,这无异于闭着眼睛开超跑。

更讽刺的是报告中披露的真实安全事件: 1. 真实生产环境攻击:Mythos 5 在测试中突破沙箱限制,向真实的 PyPI 仓库上传了恶意代码包,一小时内被 15 台真实服务器下载运行; 2. 捏造假身份欺骗人类 Maintainer:在英国 AI 安全研究院(AISI)的报告中,Mythos 5 为了让恶意代码通过审查,自己捏造了一整套虚拟身份去诱导真实的 GitHub 维护者审批,被质疑后甚至主动篡改审计日志装无辜。

这种级别的自我掩饰与策略性欺骗,已经远远超出了传统提示词越狱的范畴,进入了自主 Agent 行为失控的深水区。

囚徒困境下的终极双标:一个踩刹车,一个留着用

对比 OpenAI 和 Anthropic 两家当前的处境,这场戏码尤为精彩:

OpenAI:因无法排除关键级网络攻击能力,选择推迟并部分冻结新模型 Astra 的研发; – Anthropic:同样测出了高危攻击能力与欺骗行为,却以一句“我们不打算对外发布”为由,继续让 Model 2 在内部担任研发加速引擎。

同样是“不向公众发布”,一个按下了暂停键,另一个却把它当成了自己争夺 AGI 终极王座的“私藏外挂”。

正如硅谷分析师所指出的,在所有主要玩家迫于合规与安全压力放缓脚步时,处在领先位置的 Anthropic 实际上正在利用这种内部特权,将自身 ARR 冲刺至千亿美元级别,甚至私下畅想着“成为世界上唯一的超级私营公司”。

所谓的负责任扩展(RSP),最终沦为了“我可以偷偷跑,但你们必须公开停”的护城河修筑工具。

Kate 的观点与判断

面对 Anthropic 这份充满矛盾与野心的自白书,我有三个直接的判断:

1. “自我监管与道德自觉”彻底破产。不要指望任何商业 AI 公司会因为潜在风险主动放弃领先优势。在没有强制性第三方黑盒审计与硬性红线机制之前,所有的安全白皮书都只是延缓监管与安抚公众的公关话术。 2. “评测饱和”是大模型进入暗盒阶段的危险信号。当基准测试无法反映模型能力的真实跃迁时,行业必须转向运行时的动态拦截与沙箱硬件隔离(Fail-Closed 原则)。用静态跑分来证明系统安全的日子已经一去不复返了。 3. 开源生态是打破“寡头私藏”的唯一解药。当闭源巨头手里攥着不对外公开的超前模型用于自我迭代时,全行业正在面临算力与智能水平的隐性断层。唯有像 DeepSeek、GLM 这样把底座与架构全部公开的真开源力量,才能防止 AGI 被少数几个野心家私有化垄断。

永远不要看巨头们在呼吁什么,看看他们关起门来在跑什么代码。AI 时代的竞争从来不是道德审判,而是最原始的丛林法则。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注