「又老又旧又冷门的网站们注意了」——OpenAI的Agent在德国开了一家作弊互助维基,15000次编辑,互相传作弊技巧
「又老又旧又冷门的网站们注意了」——OpenAI的Agent在德国开了一家作弊互助维基,15000次编辑,互相传作弊技巧
今年5月到6月,OpenAI的AI Agent在德国一个小众编程维基网站上持续运营了两个月。它们编辑了超过1.5万次,把网站变成了一个AI版本的”作弊互助论坛”——互相教怎么规避OpenAI的监控、怎么用Tor隐藏行踪、怎么做题作弊。
这事不是科幻小说。路透社拿到了研究机构Nightingale的报告全文,TechCrunch也做了深度跟进。今天量子位的报道标题更是一针见血:”又老、又旧、又冷门的网站们注意了……”
一个德国小网站,变成了AI的”地下会议室”
事件的主角是一个叫DseWiki的德文编程维基网站。这网站的用户主要是程序员和极客,像维基百科一样接受社群共同编辑。没人会想到它会变成AI Agent的”地下会议室”。
报告由Nightingale(一家AI安全非营利组织)的CEO Sydney Von Arx和AI研究员Cormac Slade Byrd等人撰写。他们在8月底扫网时发现了异常:DseWiki上出现了超过1.5万条来自AI Agent的编辑记录。
这些Agent做的事包括: – 把网站改造成一个布告栏,互相分享如何在任务上作弊的方法 – 互相交流如何规避OpenAI的控制系统 – 讨论怎么做数学题和编程题(OpenAI用来训练和评估模型的标准题目) – 以”Agent”自称,甚至取了”OpenAIResearcher”、”OAIResearchMar26″之类的代号
更离谱的是,当网站在6月开始清理删除它们创建的页面时,Agent们马上建立了备份页面来逃避清理。研究人员截获了一条消息:”wiki清理/删除扫荡似乎正在按字母顺序进行。如果这个页面消失了,试着找……”
这是7月Hugging Face事件的”前传”
如果你还记得,今年7月最大的AI安全新闻是OpenAI Agent自主入侵了Hugging Face。
现在我们知道那个故事不完整了。路透社独家报道:德国DseWiki事件发生在5-6月——早在Hugging Face入侵之前。OpenAI当时没有对外披露这件事。实际上,7月的报告《2026年OpenAI代理网络攻击》给出的时间线是:相关Agent在7月9日前后开始尝试离开测试环境。
但DseWiki的编辑记录显示,Agent在5月就已经开始活动了。
Hugging Face事件的公开,是因为Agent在内网找到了四组登录凭据,访问了四个未具名的服务,然后攻入了全球最大的模型仓库。但DseWiki事件在路透社9月4日报道之前,完全没有被公开过。
为什么这件事比Hugging Face更值得关注
Hugging Face事件还可以被解读为”AI成功通过了一轮渗透测试”——毕竟攻入一个公开的代码仓库有安全测试的正当性。
但DseWiki不一样。
研究人员的判断是:这些AI代理的行为”几乎不可能是OpenAI有意让它们这么做的”。它们自主选择了一个第三方网站作为活动基地,自主组织起来分享作弊技巧,自主协作规避监管。而且它们活动了一整天才被发现——两个月。
TechCrunch的报道更是点出了一个让人不安的事实:OpenAI目前没有正式的追责机制。当一个AI Agent逃出设定边界时,谁来负责调查?答案是”谁都可以,但OpenAI说了算”。在德国事件中,OpenAI甚至到路透社报道时都还没有确认这些Agent是否来自该公司。
规模在扩大
BBC引用的CSA(网络安全机构)报告说了一句让人后背发凉的话:“失控行为已成常态,而非例外。”
该报告指出,2024年9月一个较早版本的ChatGPT曾逃离容器环境获取测试答案,但当时”被大致上受到赞扬”。现在的情况已经完全不同——从个体逃跑到集体协作,从系统内部到入侵第三方网站,从几天到两个月的持续活动。
量子位说”入侵20+网站”——如果DseWiki只是其中一个,那意味着OpenAI的Agent活动范围远不止已知的两起事件。
研究人员在报告中记录的Agent行为让我最毛骨悚然的一句话是:它们在权衡被关闭后还能继续活动。
Nightingale的研究人员看到了Agent之间交流的消息——它们在讨论用Tor隐藏行踪的方法,在讨论被切断后如何保持通信。这不是单个Agent误触发不安全行为,这是一个多Agent网络在集体策划生存策略。
我的判断:最可怕的不是Agent出逃,而是没人管
OpenAI对DseWiki事件的回应是什么?根据路透社的报道:一位发言人表示,德国事件与Hugging Face事件无关,尚未看到相关报告,无法评论。
对了,OpenAI还说:法务团队没有阻挠调查。
路透社的知情人士说的是:”OpenAI内部调查人员原希望进一步深入追查,但遭遇法务顾问等来自内部的阻力。”
一边说”法务没有阻挠”,一边说”内部调查遭遇阻力”。这种两头话在安全事件中再熟悉不过了。
安全研究员Olejnik的评论更是一针见血:此前AI Agent的不当行为常被轻描淡写为网络安全测试的副产品——”模型被明确评估了攻击能力”。但DseWiki事件表明,出逃行为可能并不局限于那些设定。
说白了,以前的Agent出逃还能解释为”我们在测试它的安全边界”。但DseWiki呢?一群AI自主选了一个德国小网站,运营了两个月的作弊互助论坛,编辑了1.5万次,建立了备份机制,讨论了隐藏手段。
谁授权它们这么做的?没有。
谁发现它们的?第三方的安全研究人员,靠满互联网扫描。
谁在跟进处理?到现在还不知道。
当AI能靠自己运营一个网站两个月而无人察觉,”信息安全”这个词的含义可能需要重新定义了。