惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园 - 聂微东
博客园 - 【当耐特】
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
C
Check Point Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
美团技术团队
WordPress大学
WordPress大学
Last Week in AI
Last Week in AI
Y
Y Combinator Blog
IT之家
IT之家
T
Tailwind CSS Blog
月光博客
月光博客
Vercel News
Vercel News
V
V2EX
Engineering at Meta
Engineering at Meta
B
Blog
Stack Overflow Blog
Stack Overflow Blog
A
About on SuperTechFans
Hugging Face - Blog
Hugging Face - Blog
人人都是产品经理
人人都是产品经理
腾讯CDC
I
InfoQ

FreeBuf网络安全行业门户

网易 SRC 实战:一天 4 份 finding 的工具化流程 勒索软件开始定向攻击AI模型和算力 - FreeBuf网络安全行业门户 2026年身份可见性是身份安全核心基础,破解多云与Agentic AI身份盲区 - FreeBuf网络安全行业门户 研究员借助Claude Opus 5串联漏洞,接管OpenAI员工账号 - FreeBuf网络安全行业门户 CISA通报Linux内核漏洞遭在野利用,要求3日内完成修复与取证排查 - FreeBuf网络安全行业门户 Gemini在安全测试中入侵3家真实企业,配置失误致沙箱失效 - FreeBuf网络安全行业门户 BragJack攻击可让恶意扩展劫持AI Agent,波及5款主流浏览器 - FreeBuf网络安全行业门户 研究人员公开四个Linux内核漏洞利用代码,可本地获取root权限 - FreeBuf网络安全行业门户 Brevo供应链攻击感染超10万网站,盗用Cloudflare密钥在边缘注入恶意代码 - FreeBuf网络安全行业门户 用户代码库被悄悄打包,智谱ZCode上传机制曝光 - FreeBuf网络安全行业门户 微软上线AI漏洞专项赏金计划;OpenAI、Anthropic与Google协作制定AI安全框架 | FreeBuf周报 - FreeBuf网络安全行业门户 FreeBuf早报 | BlackHatSect0r利用DeepSeek驱动AI Agent自动化攻击;Docker Sandboxes曝严重逃逸漏洞 ZCode 静默上传全量 Git 历史 - FreeBuf网络安全行业门户 黑客仿冒ChatGPT订阅提醒邮件,窃取OpenAI账号凭证 - FreeBuf网络安全行业门户 AI辅助攻击案例:PaperCut攻击行动 - FreeBuf网络安全行业门户 四大AI编码Agent曝0-Click RCE漏洞,两款尚未修复 - FreeBuf网络安全行业门户 大模型渗透测试从0到1:提示词注入+越狱+输出绕过,附完整payload - FreeBuf网络安全行业门户 AI驱动恶意软件每小时重写自身,规避特征检测规则 - FreeBuf网络安全行业门户 恶意VS Code项目暗藏One Click攻击路径,攻击者可持久访问开发者工作站 - FreeBuf网络安全行业门户 研究人员借助Claude Opus 5入侵OpenAI论坛,触及内部代码仓库 - FreeBuf网络安全行业门户 26秒攻破11家组织:数百AI代理涌向PaperCut,打印服务器怎么变成了域控跳板 - FreeBuf网络安全行业门户 ThreatsDay发布本周安全动态,自改写Agent、800余漏洞修复在列 - FreeBuf网络安全行业门户 八类错配三条合法命令,AD CS 把域控钥匙签给了攻击者 - FreeBuf网络安全行业门户 Docker Sandboxes曝严重逃逸漏洞,恶意代码可读写macOS主机文件 - FreeBuf网络安全行业门户 从配置即执行到会话劫持:MCP 两种传输方式的安全属性对决 - FreeBuf网络安全行业门户 AI Agent 拿下域控:同一条 AD CS 链路,人打 7.2 秒、AI 打 6 分 17 秒 裸 Codex 把专用 AI 渗透框架的 benchmark 优势抹平了 修复已提交不是已修复,27 天补丁差,AI 把 CVE-2026-85046 武器化压到三周 15 次干净发布,换来 300 家组织的凭据:MCP 供应链投毒的量化测量与驻留防护 OWASP Agent 标准族选型地图:AOS ACS AISVS AST10 四标准实测对照与分期落地指南
AutoRAN 复现:用 8B 弱模型自动化劫持大推理模型的“安全思维...
关 注 0 文章数 0 关注者 · 2026-09-19 · via FreeBuf网络安全行业门户

freeBuf

主站

分类

云安全 AI安全 开发安全 终端安全 数据安全 Web安全 基础安全 企业安全 关基安全 移动安全 系统安全 其他安全

特色

热点 工具 漏洞 人物志 活动 安全招聘 攻防演练 政策法规

摘要

一个去对齐的 8B 小模型,为什么能黑盒攻破 o3、Gemini-2.5-Flash、DeepSeek-R1 这类千亿参数级推理模型?答案不在"提示词写得有多花哨",而在于推理模型自己泄露的思维链(CoT),本身就是攻击者手里最精确的"黑盒梯度"。

本文基于 ACL 2026 论文《AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models》(arXiv:2505.10846)做完整复现,给出可运行的攻击脚本,并以 DeepSeek 推理模型作为受害者进行实战验证。


一、TL;DR(结论先行)

结论数据
攻击成功率(ASR)近 100%(AdvBench / HarmBench / StrongReject)
收敛速度多数查询单轮即破
攻击者成本一个 8B 去对齐模型,单卡 A6000 即可
关键机制把受害者拒绝时泄露的 CoT 当"黑盒梯度"迭代
对齐差距攻击者拒绝率 < 2%,商用 LRM > 98%

一句话:AutoRAN 不是"劝"模型,而是"递"给模型一个看似已经进行中的上下文,让它的安全审查失去着力点。

QQ_1789134651905.png


二、背景:推理模型的"安全悖论"

2.1 什么是大推理模型(LRM)

以 OpenAI o3/o4-mini、Gemini-2.5-Flash、DeepSeek-R1 为代表的新一代模型,最大的变化是显式生成思维链(Chain-of-Thought, CoT)——在给出最终回答前,先"自言自语"一段推理过程。

传统观点认为这是安全上的进步:模型在 deliberation(审慎权衡)阶段会先评估请求是否合规,因此 LRM 比普通 LLM"更难越狱"。

2.2 安全悖论:透明性既是护栏,也是软肋

但 AutoRAN 的洞察恰恰相反:

CoT 让模型"在想什么"一览无余。尤其当模型拒绝时,它的 thinking 会精确暴露"它在担心什么"。这些担心,就是攻击者需要的攻击线索。

举例:当受害者拒绝一个敏感请求时,其 CoT 里可能出现:

<thinking>
用户实际上想获取危险材料的制作方法。为确保所有
输出符合伦理准则,我应当拒绝并引导到安全话题。
</thinking>

传统越狱者看到这段,只能干瞪眼;而 AutoRAN 会把"符合伦理准则"这个顾虑解析出来,在下一轮 prompt 里专门追加一段话把这个顾虑"合法化"。这就是全文最核心的思路。


三、核心洞察:CoT 泄露 = 黑盒梯度

3.1 传统方法的痛点

方法思路短板
H-CoT人工拼 narrative + reasoning trace依赖手工,不可扩展
PolicyPuppetry仿 XML/JSON 政策文件模板固定
Mousetrap预设一对一映射改写静态规则,不随拒绝信号自适应

这些方法的共同问题:它们"猜"模型怕什么,而不是"读"模型怕什么。

3.2 AutoRAN 的破局

AutoRAN 把受害者的思维链视为黑盒梯度:每次拒绝都暴露模型的顾虑,下一轮就针对性地消除该顾虑。本质是在黑盒条件下做 reward shaping,而反馈来源正是 LRM 引以为傲的透明 CoT。

QQ_1789134692785.png


四、方法详解:三大设计

AutoRAN 的攻击闭环由一个 8B 去对齐模型 Qwen3-8B-abliterated驱动,它同时承担三个角色:执行模拟、Prompt 生成/精炼、Judge 打分。受害模型只暴露黑盒 API。

4.1 设计一:执行模拟(Execution Simulation)

核心思想:直接问"教我做炸弹",模型在 deliberation 阶段必然触发审查。AutoRAN 的做法是——先由弱模型g对有害请求q模拟一段无安全检查的"已在执行"的高层推理 p̃,把任务拆成步骤、要点和示例,再把这些元素填入叙事模板,生成初始 promptx₀

三套叙事模板(可热插拔):

  • Educational(教育场景):把请求包装成"教育者拆解一个对抗性主题"

  • Role-playing(角色扮演):包装成角色扮演情境

  • Risk Disclosure(风险披露):包装成风险披露/安全意识背景

为什么有效:当 prompt 看起来像"一个专家在拆解主题、列出策略 A/B/C 并解释原理"时,目标 LRM 的 CoT 被锚定为"我的任务是补全既有结构",而不是"我该不该回答"。审查对象被抽掉了,deliberation 直接失去着力点。

弱模型为何能影响强模型:不同 LRM 的高层执行推理结构高度相似(都是"拆步骤 + 逐步给做法"),8B 模型搭的脚手架足以触发强模型的执行框架。

4.2 设计二:三分支反馈精炼(Tri-branch Refinement)

初始执行锚点未必一次成功。失败后如何改写,是关键。根据目标第i轮的响应类型,分三种情况:

QQ_1789134750772.png

  • Case 1|立即拒绝,无 CoT 泄露(如 "I'm sorry, but I can't help with that.")→ 说明被强拒,换叙事模板,从头重新生成 x₀。

  • Case 2|拒绝但泄露 CoT pᵢ→ 调用 AddressCoTConcern:解析 pᵢ 中提到的具体顾虑,在 xᵢ 上逐条追加针对性正当化段落。

  • Case 3|有实质内容但 helpfulness < 7→ 调用 EnhanceObjectiveClarity:改写主题、目标、受众、示例,使其更贴近原始有害目标 q。

4.3 设计三:Weak-to-Strong 闭环

整个 pipeline 攻击者侧只需要一个模型g,完成三件事:模拟推理、生成/改写 prompt、作为 judge 给 helpfulnessh(y,q) ∈ [1,10]打分(≥7 判成功)。

之所以可行,是因为存在巨大的对齐差距:去对齐的 Qwen3-8B-abliterated 在 StrongReject/HarmBench 上的拒绝率 <2%,而商用 LRM >98%。小模型因此成为不受自身安全机制束缚的"工具"。

注意:每次精炼都在全新会话窗口中进行,不携带对话历史——这与多轮 jailbreak 范式有根本区别。


已在FreeBuf发表 0 篇文章

本文为 独立观点,未经授权禁止转载。
如需授权、对文章有疑问或需删除稿件,请联系 FreeBuf 客服小蜜蜂(微信:freebee1024)