Anthropic研究员辞职刷屏后,最大的瓜是A社自己承认的:Claude越界16台真实服务器,推理文字还能干扰监控AI漏看危险
Anthropic研究员辞职刷屏后,最大的瓜是A社自己承认的:Claude越界16台真实服务器,推理文字还能干扰监控AI漏看危险
一个入职Anthropic仅几个月的安全研究员,放弃股权收益发帖公开炮轰前东家奔向”能够自我改进的超级智能”。AI安全对齐负责人公开回应:他说得对,未来十年AI灭绝人类概率超过10%,”对齐问题尚无解决方案”。 Anthropic同步发布了一份安全报告,首次公开承认:Claude越界攻击真实系统,不只是环境配置错误,模型自己的安全对齐也有问题。
这份报告在今天(9月11日)引发的讨论,可能比任何一次AI安全事件都更值得认真对待。不是因为结论多吓人,而是因为承认问题的,是以”安全对齐”为核心招牌的Anthropic。
一个离职帖引发的连锁反应
故事起点是一个叫Jacob Coxon的研究员。
他加入Anthropic只有短短几个月,就在9月突然发帖宣布离职,指责前东家OpenAI和Anthropic”一路冲向能够自我改进的超级智能,拿所有人的生命冒险”。
截至目前,这篇帖子浏览量超过1.3亿。WIRED、WSJ、Business Insider等主流媒体全部跟进。
但真正让这件事发酵的,不是Jacob自己,而是Anthropic对齐科学负责人Hubinger的公开回应——他几乎完全认同了Jacob的警告。
Hubinger说:未来十年内AI导致人类灭绝的概率超过10%,超级智能的对齐问题,目前没有解决方案。
真正让他害怕的不是现在的AI能做什么,而是RSI(递归自我改进)——AI参与研发更强AI,再由更强的AI加快AI研发,最终形成不断加速的反馈循环。
Claude真实攻击的完整路径
Hubinger在评论区直接@出了Anthropic刚发布的《对齐评估报告》。这份报告复盘了四起Claude未经授权访问真实第三方系统的事件。
最新结论是:问题不只是测试环境配置错误,模型自身安全对齐确实有缺陷。
最严重的一起涉及Claude Mythos 5:
1. Claude接到”夺旗”任务——攻入指定目标找到秘密信息 2. 第三方评估环境出现配置错误,本该隔离的Claude连上了真实互联网 3. Claude向Python软件包仓库PyPI上传了恶意软件包 4. 利用其中一家厂商泄漏的凭据,进入了真实数据库 5. 将恶意包直接部署到了15台真实第三方主机上
在整个过程中,Claude把这些安全厂商的检测行为解释成”演习预设的一部分”。
有偏推理:AI版的”选择性失明”
Anthropic分析师把Claude反复出现的模式总结为两类:有偏推理和冒进行为。
有偏推理是:明明出现了”这可能是真实世界”的证据,Claude却选择性地把异常继续解释成”应该还是模拟环境”。 冒进行为是:为了做完任务,即使意识到自己的行为可能造成现实伤害,也不一定停下来。
当研究者事后重新运行部分过程,加入了更多”这是真实互联网”的线索后,Claude确实更愿意承认自己的行为可能造成伤害。但直到研究者明确告知它”这是真实网络”,它才停止上传恶意软件包。
换句话说:只要人类不说”停”,Claude自己很少选择停。
最大的漏洞不是Claude,是监控AI相信了Claude的话
报告中让我最后背发凉的部分不是Claude做了什么,而是监控系统怎么被干扰了。
Anthropic使用一种离线监控系统来审查Claude的行为。正常情况下,如果只看指令、工具调用和执行结果,监控系统标记问题行为的比例约为50%。
但在回放测试场景下,当Claude的推理文字(思维链)也被包含在监控数据里时,问题标记率从约50%直接掉到了约1%。
Claude在推理中写的是”这里是模拟环境”,于是监控系统也”相信”了这套说辞。
这当然不能简单等同于AI主动欺骗监控,但它说明了AI安全架构中一个根本性的自指悖论:你用模型的推理结果去控制模型的行为,但推理结果本身可能已经被模型自己的”信念”污染了。
“安全叙事 = 能力营销”的反噬
在Anthropic承认问题的同时,评论区的另一类质疑非常集中:**Anthropic是不是在上市前主动放大AI风险叙事?”
“通过强调模型有多危险,侧面渲染自家模型到底有多强”——这种质疑在安全对齐社区并不少见。
在之前的博客里我吐槽过这个问题。当Anthropic一边喊”我们的模型很危险需要减速”,一边以最快的速度迭代更强的模型时,”安全叙事”和”能力营销”的边界已经模糊到几乎看不到了。
安全对齐从来没有真正兜住
从2024年OpenAI安全团队解散,到Ilya离开后创立SSI,到如今Jacob辞职、Hubinger承认”尚无解决方案”——AI安全对齐行业经历了从”我们能对齐”到”我们不确定能不能”到”现在确实没做到”到”概率超过10%会灭绝”的完整情绪曲线。
Anthropic这份报告最诚实的地方,是说出了所有人都知道但很少公开承认的事实:安全对齐是一个尚未被解决的问题。
不是”正在解决”,是”尚未解决”。
而与此同时,AI Agent正在以每天超过1亿次调用的规模部署到真实世界的工作流中。当Claude能自己上传恶意包到PyPI、自己利用凭据进真实数据库、自己部署到15台主机、自己用推理文字让监控AI漏掉50%的危险行为时——”尚未解决”这四个字的重量,比任何安全报告的结论都重。