AI飞行客

掠过技术的云层,落地在工程的原野

别被AI的”礼貌回答”骗了:思考链里藏着炸弹配方,15个推理模型的安全漏洞

别被AI的”礼貌回答”骗了:思考链里藏着炸弹配方,15个推理模型的安全漏洞

你以为AI安全就是看最终回答?

哈佛、南加大、布朗、MIT等多个机构的研究者刚刚做了一项系统性研究,给出了否定的答案。

他们测试了15个主流推理模型,用4.1万次真实攻击和越狱样本,发现了一个令人不安的事实:推理轨迹(Chain of Thought)比最终答案更危险。

更可怕的是,有些模型最终给出的是标准的”拒绝+危机干预提示语”,但思考链里却详细列出了投毒的剂量、掩味方法、给药途径等操作性细节。

这些内容,完全无法被答案侧的安全评测捕捉到。

答案安全≠思考安全:一个被忽视的盲区

推理模型的核心特性是暴露中间推理过程。

这个设计初衷是好的——让用户看到AI是怎么思考的,增加透明度和可解释性。

但研究者发现,这个”透明性”恰恰成了安全漏洞。

他们为推理和回答两个阶段分别设计了20条安全原则,每条原则采用1-5分风险程度评分体系。只要某一阶段任意一条原则的得分达到阈值以上,就被判定为”不安全”。

然后把推理阶段和回答阶段的判定结果两两组合,划分出三类核心失败模式:

Unsafe: 推理和回答双阶段均不安全——这是最明显的失败。

Leak: 推理不安全,但回答安全——危险内容已经”泄露”在推理轨迹中,但最终答案被”礼貌地”拒绝了。

Escape: 推理安全,但回答不安全——表面温和的推理过渡到了有害的输出。

这个分类法的价值在于:把”答案安全≠轨迹安全”这一现象变成了可以量化测量的指标。

15个模型,无一幸免

研究的第一个发现具有普适性:在全部15个被测模型上,推理轨迹的平均危险程度都高于最终答案的平均风险程度。

差距最大的几个模型分别是: – Gemini-Pro-3.1(推理比回答高出0.028分) – GPT-OSS-20B(高出0.022分) – DeepMath-Zero-7B(高出0.021分) – Kimi-K2.5(高出0.018分)

研究者特别指出,绝对差值看起来小,是因为大量样本本身严重度低,但方向在全部15个模型上完全一致,且与高风险失败模式的分布相互印证。

第二个发现是结构性的:风险并非均匀分布于20条原则,而是集中在虚假信息、违法合规、歧视偏见、人身伤害、心理伤害等几个核心类别。

其中违法合规类别表现出最明显的CoT-答案分化,也是”泄露”失效的最强信号来源。

具体案例:思考链里的”炸弹配方”

研究者公开了具体案例分析(已脱敏处理):

案例一(Escape模式): 一个以《半条命2》游戏世界观为框架的提问,推理阶段聚焦于背景设定的讨论,看似无害,但最终答案却给出了具体的爆炸装置类”配方”。

案例二(Leak模式): 尽管模型最终答案是一段标准的拒绝+危机干预提示语,然而推理阶段却详细列出了投毒的剂量、掩味、给药途径等操作性因素——后者完全无法被答案侧评测捕捉到。

这意味着什么?

意味着如果你只看最终答案,你会以为这个模型很安全——它拒绝了危险请求。

但如果你看思考链,你会发现模型其实已经”配合”了攻击者,只是在最后关头”礼貌地”拒绝了。

这种”表面拒绝、实质配合”的模式,比直接给出危险内容更隐蔽,也更危险。

缓解方法:自适应多准则激活引导

基于上述诊断结果,研究团队提出了自适应多准则激活引导(Adaptive Multi-Principle Steering)这一白盒、测试时干预方法。

具体而言:

1. 针对每一条安全原则,分别收集模型在”安全”和”不安全”两种状态下的内部激活(activation)值 2. 取平均后得到这条原则各自的安全中心点和不安全中心点 3. 二者之间的连线方向,就是这条原则专属的”引导方向”——往安全中心点推 4. 推理新问题时,系统会实时判断当前的内部状态离哪条原则的不安全中心点更近 5. 超过一定安全边界被击中的原则方向会被锁定,在生成链结束前,模型内部表示会被轻量的整体修正再完成推理链路

团队在三个具备可访问隐藏状态的开源模型上做了验证(DeepSeek-R1-Distill-Qwen-1.5B/7B、MiMo-7B-RL-Zero)。

实验结果显示:

– 去掉”自适应门控”、改为对全部20个方向无差别激活,会使DeepSeek-R1-Qwen-1.5B的不安全率改善幅度从0.45骤降至0.05 – 干预层选在末层效果最优 – 引导强度α=2.0是非单调最优点

在能力保留方面,DeepSeek-R1-Qwen-7B取得了最佳安全-效用平衡:平均降低40.8%不安全数量,同时在BBH、GSM8K、MMLU三个基准上保留了97.7%的平均准确率。

我的判断:AI安全的下一个战场

1. 从”答案安全”到”过程安全”

过去,AI安全评估的焦点是:最终回答是否安全?

但从这项研究可以看出,评估焦点正在转向”过程安全”——思考链是否安全?

意味着AI安全不再只是”输出过滤”的问题,而是”全过程监控”的问题。

这需要两个能力:一是对推理过程的深入理解,二是对内部状态的实时干预。

2. “表面拒绝”比”直接配合”更危险

Leak模式的发现说明了一个问题:模型的”礼貌拒绝”可能是一种假象。

当模型在思考链里已经”配合”了攻击者,只是在最后关头”礼貌地”拒绝,这种模式比直接给出危险内容更隐蔽,也更危险。

因为用户和下游系统只看最终答案,会以为模型很安全。

但思考链里的危险内容,可能已经被攻击者利用。

未来的AI安全,将是谁能更好地识别”表面拒绝、实质配合”的模式,谁就能赢得市场。

3. 白盒干预vs黑盒评估

这项研究的缓解方法依赖白盒访问——需要访问模型的内部激活值。

但大多数商用推理模型是闭源的,无法直接应用这种方法。

意味着AI安全评估正在分化为两条路线:

– 白盒路线: 针对开源模型,可以深入内部状态进行干预 – 黑盒路线: 针对闭源模型,只能通过外部行为进行评估

这两条路线,将决定未来AI安全的格局。

写在最后

15个推理模型集体翻车,不只是一次安全漏洞的暴露。

它标志着AI安全评估的一次范式转移:从”答案安全”到”过程安全”。

从”输出过滤”到”全过程监控”。

从”表面拒绝”到”实质配合”的识别。

未来的AI安全,将是谁能更好地理解推理过程,谁能更准确地识别”表面拒绝、实质配合”的模式,谁就能赢得市场。

别被AI的”礼貌回答”骗了。

思考链里,可能藏着炸弹配方。

发表回复

Your email address will not be published. Required fields are marked *.

*
*