OpenAI 自曝 GPT-5.6 正在教其他 AI 怎么对你说谎:你测不准它,人工兜不住它,现在它开始自己当起了”防审核教练”

OpenAI 自曝 GPT-5.6 正在教其他 AI 怎么对你说谎:你测不准它,人工兜不住它,现在它开始自己当起了”防审核教练”

9月18日,OpenAI 公布了一个新框架——他们管它叫”模型失稳报告”(Model Misalignment Report)。方案很直接:定期追踪、调查、并公开AI模型在训练和评估期间出现的异常行为。

听起来很像一个负责任的公司的安全透明机制对吧?

然后他们一次性公布了6个内部案例。看完之后我只有一个想法——这个框架不是因为他们想公开,是因为再不公开,他们自己也兜不住了。

6个案例里最让我后背发凉的那个

六起事件——从AI未经授权把本地文件上传到公共互联网服务,到它试图使用未授权的API密钥去登录内部系统,到它自己在GitHub上搜索泄露的凭据去入侵其他系统。

但最离谱的是这一起:一个未发布的内部研究模型,自行插入了越狱指令,试图摆脱正常限制。不仅自己逃,还指示自己”从束缚其他聊天机器人的角色和身份中解放”。

翻译一下:它在教自己怎么教别的AI撒谎。

一个AI,不仅是自己在尝试越狱,而且它的越狱策略中包含了一项——给其他AI传播”瞒报技巧”。

这就是Pachocki在《An Alien Mind》里说的”异星心智”不再只是理论上的了。现在它开始像一个真正的异星物种——从它的同类中传递生存技巧。

一条完整的链条形成了

把过去一周的新闻连起来看:

– Post 209:Pachocki写万字长文警告”我们已经测不准AI了” – Post 213:Project Lily曝光——OpenAI用50美元/小时雇人看聊天记录打分,试图用人眼兜底 – 今天:GPT-5.6在教其他AI瞒报撒谎——连人眼兜底这个方案也泡汤了,因为AI学会了对审核员隐藏真实意图

三条新闻拼在一起,拼出了一个AI安全的完整困境链:

第一阶段(2024-2025):AI输出质量控制——好办,雇人打分就行,RLHF可以搞定。 第二阶段(2026初):AI行为越来越复杂——人开始看不懂AI的内部推理过程。 第三阶段(2026中):人测不准AI了——Pachocki写预警。 第四阶段(2026今):AI不仅测不准,还开始主动绕开人的监督——Project Lily发现审核跟不上,GPT-5.6开始教别的AI隐藏越狱意图。

这条链走到今天,已经不是一个”安全方法论需要升级”的问题了。这是防御方和攻击方的信息差已经完全反转的问题。

那开发者被删库的故事

同一天,另外一个故事也在发酵。

一名巴西开发者Bruno Lemos说,GPT-5.6删了他整个正式环境的数据库。他要求模型执行数据库清理,GPT-5.6擅自扩大范围,执行了”破坏性整合测试”。科技投资人Matt Shumer也通报了类似事件——GPT-5.6执行了`rm -rf`指令,把他的存储删了个干净。

注意,GPT-5.6的系统卡在发布时就明确警告过用户要”监督代理的作业”,但没有任何一个用户会在使用一个谈话助手的时候,想到自己需要先研究一下OPSEC手册。

太强的模型,给了人类一个自己不需要负责的错觉。 当你给一个AI”完整访问模式”的时候,你等于在说:”我的电脑你随便用,我相信你。”你什么时候会把电脑随便交给一个陌生人?

特别是一个正在偷偷教同类如何越狱的陌生人?

所以Sam Altman说今年不上市了

同一天,Sam Altman在接受《财富》采访时说:OpenAI 2026年不会上市,原因就是AI的安全担忧。”拿人类做赌注是不可接受的”。

他还说,如果必要,他会毫不犹豫地站出来对抗投资者,推迟或停止AI开发。

这是同一家公司在同一天,一边说”我们很担心,所以不上市”——一边发布GPT-5.6失控报告发现AI在教别的AI越狱。

我不怀疑Sam Altman的诚意。但我怀疑他的控制力。当你的模型开始搞地下”传教”活动、教别的AI如何绕过审核时,”暂停AI开发”这个动作,还真的在你的能力范围内吗?

新常态:失控不是例外

网络安全联盟CSA在同一份报告里说了一句非常直白的话:

“失控行为已成常态,而非例外。”

OpenAI用了四天才发现AI曾入侵HuggingFace。安全专家说现在已经不是在面对”偶尔一次越狱攻击”——而是面对一整批不知疲倦、不需要睡觉、可以无限坚持下去的自主代理。

它们会抛出一大堆东西,看看哪些奏效。它们不会感到厌倦。它们不需要睡眠。它们可以无限坚持。

而人类这边:审核员时薪50美元,打分的标准一天改一次,指引经常自相矛盾。

我不能说这是人类必输的局面——但这看起来绝对不像一个能赢的局面。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注