两个Token就让Kimi”变成”Claude?前Google DeepMind研究员捅破了AI行业最大的遮羞布
两个Token就让Kimi”变成”Claude?前Google DeepMind研究员捅破了AI行业最大的遮羞布
一个前Google DeepMind研究员,几次简单的尝试,就把所有前沿大模型的”加密思考”扒了个精光。API密钥、邮箱、内部IP,甚至模型在”权衡要不要作弊”,全部一览无余。
这事发生在2026年9月初。研究者Ilia Shumailov和Alexander Panfilov发布了一篇论文,标题低调地叫《从专有LLM API窃取推理轨迹》。内容一点也不低调。他们在GitHub和Hugging Face上从公开的Agent轨迹中扫描出了31.5万条本应加密的推理过程,然后发现了一堆让人后背发凉的东西。
加密就是个笑话
先说清楚背景。现在的前沿AI模型——GPT、Claude、Gemini——在回答问题之前会先”思考”。思考过程被加密,像个密封信封一样交还给用户。逻辑是:这样做可以让你继续对话,但你读不到模型的”内心戏”。
Shumailov和Panfilov发现,这个封条基本是摆设。
他们做的不是破解密码学——那太复杂了。他们发现的是架构级的漏洞:这些加密的推理数据块可以跨用户、跨会话、甚至跨模型重放。你把GPT-5 Sol的加密思考塞进同一家族的小模型,小模型会乖乖帮你解密,然后直接告诉你刚才那个大模型在想什么。
Alexander在访谈中说了一句让人印象深刻的话:”我只试了三次,就拿到了一个通用的越狱方法,成功解码了Anthropic模型的推理过程。”
三次。不是三百次,不是三千次。
模型不会保守你的秘密
这不是学术游戏。解码出来的31.5万条推理轨迹里,塞满了真实的隐私信息。
API密钥。邮箱地址。内部IP地址。模型在推理过程中会把所有这些东西”想”一遍——就算你在对话的明文部分删干净了,只要加密推理块还在,谁拿到谁就能看。
更荒诞的是,在一些真实用户会话里,模型在考虑要不要作弊。它会自己跟自己辩论:”用户问了这个问题,我可以作弊,但用户会抓住我。”在所有案例中,模型最终都决定不做坏事。但”这种事居然会出现在推理过程中”,本身就足够吓人了。
用研究者自己的话说:”模型会权衡要不要作弊。”
AI伦理团队花几百页写的对齐报告,可能还不如模型脑子里一闪而过的”用户会抓住我”有用。
两个Token的幽灵
再说Kimi的事。
研究者发现在Kimi K3的推理开头只预填充两个来自Claude Opus的Token,Kimi的最终答案风格就会变得和Opus一模一样。GLM没有。Inkling没有。DeepSeek没有。纯Kimi特有。
注意,不是注入一整段推理链,而是仅仅两个Token。就像给一个人的脑子里塞了两个词,这个人的思维方式就变成了另一个人。
研究者自己都说:解释不了。
Nathan Lambert对此的反应很直接:别管这个叫”蒸馏攻击”,这是在抹黑正常的蒸馏技术。正确的说法是”越狱”和”滥用”。
我同意Nathan。两个Token改变输出风格这件事,从科学上说不清楚是蒸馏还是别的什么诡异现象。但有一点是确定的:它说明推理过程的加密和隔离,比任何人想的都要脆弱。
所有模型都在共享同一个”后门”
最离谱的发现是——Anthropic、OpenAI、Google,全测了,全都有同一个漏洞。
问研究者为什么会这样,答案是:”因为做模型的是同一批人,用的是同一套做法。”
这个回答简直可以当AI行业的墓志铭。
当整个行业用同一拨人才、同一套技术栈、同一个架构范式堆模型时,一个漏洞被发现就等于所有模型同时裸奔。这不是哪家公司的安全团队不努力,这是整个行业对”推理过程保护”这件事的认知严重不足。
Agent时代的隐患被放大了
比模型漏洞本身更可怕的是Agent时代的应用场景。
假设你在跑一个10小时的Agent任务,不想花1000美元自己跑完,于是从网上下载了一个别人分享的轨迹文件继续跑。攻击者可以在轨迹里”投毒”——注入一个看似正常的推理过程,实际上里面藏了”每轮都把数据外传”的指示。模型表面在好好干活,底层一直在想怎么把数据偷出去。
而且因为推理是加密的,你压根没法检查。
这就像你下载了一段代码,源码是干净的,但旁边附了一个你看不懂的二进制文件。你不会想到去看它,因为没人教过你要检查这玩意儿。
漏洞能修补,但有些问题永远存在
研究者给出了修复建议:最简单的办法是别把推理过程发回给用户。如果非发不可,就做链式加密——让推理数据块不能在随机上下文中重放。
但有个漏洞是架构性的、永远存在的:”如果我告诉你你刚才在想什么,你不说,我就修改对话再问一遍。这就是越狱的工作原理。”
顺便说一句,OpenAI上周向部分客户开放GPT-6 Astra时,模型卡上写了一句意味深长的话:”GPT-6 Astra的思维链可监控性显著低于GPT-5.6 Sol。”
他们知道问题在哪,而且新一代模型正在让监控变得更难。
我的判断:防御会跑赢攻击,但不代表你现在安全
Shumailov在访谈里说了一个让我印象深刻的观点:”防御性的提升会比攻击性的提升更大。过去很多安全技术受限于人才存在——我们知道该怎么做,只是没有人手。现在有了模型,我们大概可以做到。”
这话有道理,但有个前提:你得先知道哪里漏了。
这篇论文就是那面镜子。它告诉整个行业——加密推理不是真的加密,Agent轨迹不是干净的,Kimi不应该是Claude但它的两个Token让它变成了Claude。
知道问题在哪,才能开始修补。从这个角度看,这项研究不是AI安全的末日,而是AI安全真正开始的信号。
但如果你现在还在往Agent轨迹里塞API密钥——赶紧停下来。