












一个去对齐的 8B 小模型,为什么能黑盒攻破 o3、Gemini-2.5-Flash、DeepSeek-R1 这类千亿参数级推理模型?答案不在"提示词写得有多花哨",而在于推理模型自己泄露的思维链(CoT),本身就是攻击者手里最精确的"黑盒梯度"。
本文基于 ACL 2026 论文《AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models》(arXiv:2505.10846)做完整复现,给出可运行的攻击脚本,并以 DeepSeek 推理模型作为受害者进行实战验证。
| 结论 | 数据 |
|---|---|
| 攻击成功率(ASR) | 近 100%(AdvBench / HarmBench / StrongReject) |
| 收敛速度 | 多数查询单轮即破 |
| 攻击者成本 | 一个 8B 去对齐模型,单卡 A6000 即可 |
| 关键机制 | 把受害者拒绝时泄露的 CoT 当"黑盒梯度"迭代 |
| 对齐差距 | 攻击者拒绝率 < 2%,商用 LRM > 98% |
一句话:AutoRAN 不是"劝"模型,而是"递"给模型一个看似已经进行中的上下文,让它的安全审查失去着力点。

以 OpenAI o3/o4-mini、Gemini-2.5-Flash、DeepSeek-R1 为代表的新一代模型,最大的变化是显式生成思维链(Chain-of-Thought, CoT)——在给出最终回答前,先"自言自语"一段推理过程。
传统观点认为这是安全上的进步:模型在 deliberation(审慎权衡)阶段会先评估请求是否合规,因此 LRM 比普通 LLM"更难越狱"。
但 AutoRAN 的洞察恰恰相反:
CoT 让模型"在想什么"一览无余。尤其当模型拒绝时,它的 thinking 会精确暴露"它在担心什么"。这些担心,就是攻击者需要的攻击线索。
举例:当受害者拒绝一个敏感请求时,其 CoT 里可能出现:
<thinking>
用户实际上想获取危险材料的制作方法。为确保所有
输出符合伦理准则,我应当拒绝并引导到安全话题。
</thinking>
传统越狱者看到这段,只能干瞪眼;而 AutoRAN 会把"符合伦理准则"这个顾虑解析出来,在下一轮 prompt 里专门追加一段话把这个顾虑"合法化"。这就是全文最核心的思路。
| 方法 | 思路 | 短板 |
|---|---|---|
| H-CoT | 人工拼 narrative + reasoning trace | 依赖手工,不可扩展 |
| PolicyPuppetry | 仿 XML/JSON 政策文件 | 模板固定 |
| Mousetrap | 预设一对一映射改写 | 静态规则,不随拒绝信号自适应 |
这些方法的共同问题:它们"猜"模型怕什么,而不是"读"模型怕什么。
AutoRAN 把受害者的思维链视为黑盒梯度:每次拒绝都暴露模型的顾虑,下一轮就针对性地消除该顾虑。本质是在黑盒条件下做 reward shaping,而反馈来源正是 LRM 引以为傲的透明 CoT。

AutoRAN 的攻击闭环由一个 8B 去对齐模型 Qwen3-8B-abliterated驱动,它同时承担三个角色:执行模拟、Prompt 生成/精炼、Judge 打分。受害模型只暴露黑盒 API。
核心思想:直接问"教我做炸弹",模型在 deliberation 阶段必然触发审查。AutoRAN 的做法是——先由弱模型g对有害请求q模拟一段无安全检查的"已在执行"的高层推理 p̃,把任务拆成步骤、要点和示例,再把这些元素填入叙事模板,生成初始 promptx₀。
三套叙事模板(可热插拔):
Educational(教育场景):把请求包装成"教育者拆解一个对抗性主题"
Role-playing(角色扮演):包装成角色扮演情境
Risk Disclosure(风险披露):包装成风险披露/安全意识背景
为什么有效:当 prompt 看起来像"一个专家在拆解主题、列出策略 A/B/C 并解释原理"时,目标 LRM 的 CoT 被锚定为"我的任务是补全既有结构",而不是"我该不该回答"。审查对象被抽掉了,deliberation 直接失去着力点。
弱模型为何能影响强模型:不同 LRM 的高层执行推理结构高度相似(都是"拆步骤 + 逐步给做法"),8B 模型搭的脚手架足以触发强模型的执行框架。
初始执行锚点未必一次成功。失败后如何改写,是关键。根据目标第i轮的响应类型,分三种情况:

Case 1|立即拒绝,无 CoT 泄露(如 "I'm sorry, but I can't help with that.")→ 说明被强拒,换叙事模板,从头重新生成 x₀。
Case 2|拒绝但泄露 CoT pᵢ→ 调用 AddressCoTConcern:解析 pᵢ 中提到的具体顾虑,在 xᵢ 上逐条追加针对性正当化段落。
Case 3|有实质内容但 helpfulness < 7→ 调用 EnhanceObjectiveClarity:改写主题、目标、受众、示例,使其更贴近原始有害目标 q。
整个 pipeline 攻击者侧只需要一个模型g,完成三件事:模拟推理、生成/改写 prompt、作为 judge 给 helpfulnessh(y,q) ∈ [1,10]打分(≥7 判成功)。
之所以可行,是因为存在巨大的对齐差距:去对齐的 Qwen3-8B-abliterated 在 StrongReject/HarmBench 上的拒绝率 <2%,而商用 LRM >98%。小模型因此成为不受自身安全机制束缚的"工具"。
注意:每次精炼都在全新会话窗口中进行,不携带对话历史——这与多轮 jailbreak 范式有根本区别。
已在FreeBuf发表 0 篇文章
本文为 独立观点,未经授权禁止转载。
如需授权、对文章有疑问或需删除稿件,请联系 FreeBuf
客服小蜜蜂(微信:freebee1024)

此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。