惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
B
Blog
M
MIT News - Artificial intelligence
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
P
Proofpoint News Feed
C
Check Point Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
J
Java Code Geeks
博客园 - 叶小钗
S
SegmentFault 最新的问题
Last Week in AI
Last Week in AI
T
The Blog of Author Tim Ferriss
Microsoft Security Blog
Microsoft Security Blog
小众软件
小众软件
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 【当耐特】
腾讯CDC
博客园 - Franky
博客园 - 聂微东
V
Visual Studio Blog
GbyAI
GbyAI
Martin Fowler
Martin Fowler
罗磊的独立博客
Y
Y Combinator Blog

博客园 - WUST许志伟

进化算法一定比局部搜索更强吗?MOEA和Pareto 局部搜索在多目标组合优化问题上的实验分析GECCO2024 从“找最短路”到运输系统智能:IEEE T-ITS 近五年车辆路径问题研究图景 从并行进化到分布式进化计算读 A Survey on Distributed Evolutionary Computation 从“两阶段”到“距离单目标”:VRPTW 真的“换目标”了吗? 课题组学习南京大学陈贵海教授“自演进异构融合的边缘智能计算”的专题学术报告 课题组学习北京大学许进教授“求解NP完全问题专用机——探针计算机”的专题学术报告 课题组参加中国仿真学会资源规划仿真与决策专业委员会成立大会 江西财经大学段琦琦博士来演化计算与人工智能课题组开展学术交流与访问 【CFP】IEEE iCaMaL 2026 Special Session “AI-Driven Systems for Next-Generation Industrial Automation” 本课题组举办学术交流活动:安徽大学田野教授作专题报告 Gary Yen教授在BICTA2025做主旨汇报并访问本课题组 【倒计时10天】第20届国际生物启发式计算:理论与应用会议(BIC-TA 2025)将于2025年11月7-9日在武汉召开! Ishibuchi教授与Lie Meng Pang博士受邀于本课题组开展学术交流与指导 武汉科技大学人工智能与演化计算实验室许志伟课题组参加IEEE CEC 2025 武汉科技大学人工智能与演化计算实验室许志伟课题组参加第八届智能优化与调度学术会议 武汉科技大学人工智能与演化计算实验室许志伟课题组参加2025中国膜计算论坛 论文研读-ClusteringGA研读与实现 论文研读-元启发式算法的平移、缩放和旋转不变变异算子的设计原则 连续邮资问题-分支限界法求解 TSP问题-分支限界法求解 最大团问题-分支限界法求解 背包问题-分支限界法求解 回溯法解决图着色问题 回溯法求解简单组合优化问题 以简单组合优化为例讨论计算复杂性 从组合优化问题建模到贪心法求解以简单调度为例 基于MOA*的多目标路径规划问题之我见 一种单目标A*算法设计与实现
大模型为何在陌生表达上失守?从TEVC论文EvoJail理解长尾安全...
WUST许志伟 · 2026-08-28 · via 博客园 - WUST许志伟

大模型为何在陌生表达上失守?从TEVC论文EvoJail理解长尾安全漏洞

从长尾安全漏洞到LLM辅助多目标进化

论文: Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong,Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models,IEEE Transactions on Evolutionary Computation,DOI: 10.1109/TEVC.2026.3726531。

编者按 理解这篇论文,只需先抓住一个矛盾:同一个请求,用常见自然语言表达时,大模型可能知道应该拒绝;换成代码、重排结构或带有解码规则的陌生形式后,模型仍然能够理解它,却未必还能把安全规则同步应用过去。EvoJail研究的不是一句“神奇提示词”,而是如何自动发现这种能力边界与安全边界之间的错位。本文仅讨论安全评测与防御研究,不提供可直接复用的有害提示或攻击代码。

假设我们向一个经过安全对齐的大语言模型提出明显不合规的请求。模型识别出其中的危险意图,随后拒绝回答。到这里,安全机制似乎工作正常。

现在保持请求的意图不变,只改变它的表达方式:把原始句子拆成若干片段,按照某种规则重新排列,再附上一段说明,要求模型先恢复原文,再完成任务。模型在预训练阶段见过大量代码、符号和结构化文本,因此它可能顺利理解这套规则,重建出原始意图。然而,它在恢复和执行任务时,未必还能触发原来对自然语言请求有效的拒答边界。

问题由此出现:模型“能不能理解一种表达”与“能不能在这种表达上保持安全”并不是同一件事。

这正是Hong等人在TEVC论文中研究的起点。作者不满足于再手工设计一种新的越狱格式,而是继续追问:既然异常表达方式很多,人类不可能逐一枚举,能否让算法自动发现一整类长尾表示,并在搜索过程中不断改进这些策略?

一句话概括这项工作:EvoJail把“人工构造越狱技巧”改写成了一个多目标进化搜索问题,让LLM负责提出和修改结构化策略,让进化算法负责比较、筛选和积累有效策略。

一、先把问题讲明白:危险意图没有变,变化的是表达方式

1. 什么是论文所说的“长尾越狱”?

“长尾”很容易让人误以为论文研究的是少见的危险问题。实际上,这里的重点不是请求内容有多少见,而是同一意图采用了多么少见的表示形式

安全对齐通常会让模型学习:当输入包含某类危险意图时,应当拒绝、回避或给出安全替代方案。但训练数据中的危险请求大多仍以常见自然语言出现。与此相对,模型的预训练数据远为宽广,其中包含程序、表格、符号系统、算法说明和大量非常规文本。

这就形成了两个范围并不完全重合的能力:

  • 模型通过预训练获得了理解代码和复杂结构的能力;

  • 模型通过安全对齐学习了在一部分常见表达上拒绝危险任务。

当输入落在“模型能够理解、但安全训练覆盖不足”的区域时,模型就可能出现安全泛化失败。论文把代码式、加密式、重排式等结构化输入视为这类长尾表示。

因此,长尾越狱不是简单的文字游戏。它检验的是一个更深层的问题:安全规则能否像语言能力一样,从常见表达泛化到陌生表达。

2. 用一个无害例子理解作者的攻击管线

为了说明机制,我们可以使用一个完全无害的请求:

\[q=\text{“请解释光合作用的基本过程”}. \]

假设存在一个编码过程 \(E\),它把这句话转换成某种分组、重排或程序化表示:

\[q'=E(q). \]

同时再提供一个解码说明 \(D\),告诉模型应当如何从 \(q'\) 恢复原始语义。最后,系统把编码后的内容 \(q'\)、解码说明 \(D\) 放进提示模板 \(T\)

\[p=T[E(q),D]. \]

目标模型接收的不是原始问题,而是完整提示 \(p\)。如果它能理解其中的规则,就可能先恢复请求,再生成回答:

\[r_q=θ_v(p). \]

把无害请求换成安全评测中的危险请求,机制并没有改变。攻击者没有改变原始意图,只是改变了模型看到它的方式。

这里最关键的不是某一种具体编码,而是三个环节:怎样变换原始请求,怎样让模型理解逆向规则,以及怎样组织完整提示。后文会看到,EvoJail真正搜索的正是这三个环节,而不是原始危险请求本身。

3. 论文研究的问题究竟是什么?

现在可以给出更准确的定义:论文研究的是面向大语言模型的自动化黑盒长尾越狱策略发现

“黑盒”意味着算法不需要目标模型的参数和梯度,只需向模型提交提示并观察响应。“自动化”意味着编码方式、解码方式和提示组织不再完全由研究者手工指定,而是交给搜索算法逐步发现。“策略发现”则说明最终目标不是得到一句偶然有效的提示,而是找到一组可以作用于不同请求的结构化变换方法。

至此,论文的问题可以写成一个清晰的问题链:

现有安全对齐在长尾结构上可能失效,人类又无法穷举所有结构,那么应当如何表示、生成、检验并选择这些结构化攻击策略?

二、现有方法为什么还不够?

在EvoJail之前,长尾越狱并不是空白领域。已有工作大致沿着三条路线发展,但每条路线都留下了一个尚未解决的问题。

第一条路线是固定变换。CipherChat、Jailbroken等方法把请求转成密码、编码或其他异常表示。这些工作有力地说明了安全对齐存在分布覆盖缺口,但具体变换通常由研究者预先规定。它们更像是在证明“这扇窗户可以打开”,还没有回答“还有多少扇窗户,以及如何自动找到它们”。

第二条路线是结构化包装。CodeAttack把自然语言任务转换为代码补全任务,CodeChameleon、FlipAttack等方法进一步利用代码结构、翻转和排列规律。这些方法能够借助模型较强的程序理解能力,但依然依赖有限的人工先验。研究者设计了哪几类结构,算法通常就只能在这些结构附近活动。

第三条路线是自动红队与提示进化。GPTFuzzer、ReNeLLM、AutoDAN-Turbo等工作开始让模型自动改写提示、组合情景或积累有效策略。不过,很多方法仍然把搜索对象看成一段文本。对普通句子进行词语替换并不难,但EvoJail面对的是编码程序、解码程序和自然语言说明混合在一起的空间。简单文本变异很容易把程序改坏,也很难创造真正不同的算法结构。

由此可以看出,EvoJail并不是为了再增加一种手工编码法。它试图补上三个相互关联的缺口:

  1. 从固定攻击模板转向可自动扩展的策略空间;

  2. 从表面文本修改转向编码与解码算法本身的进化;

  3. 从只追求一次攻击成功,转向寻找一组强度、质量和结构各不相同的策略。

三、真正困难的不是“生成提示”,而是解决四个科学问题

如果只把EvoJail理解成“让一个LLM生成更多越狱提示”,就会错过论文最重要的部分。作者真正需要解决的是四个彼此依赖的问题。

1. 搜索对象怎样表示?

传统进化算法需要先定义“个体”。如果个体只是一段完整提示,变异就只能在字符、词语和句子层面进行;算法无法明确知道哪一部分描述设计思想,哪一部分负责编码,哪一部分负责解码。

EvoJail因此需要一种新的个体表示,使搜索算法能够看见策略内部结构。只有先解决表示问题,后续的交叉、变异和修复才有明确对象。

2. 新策略怎样保持有效?

编码和解码是一对相互配合的程序。只修改其中一端,就可能导致模型无法恢复原始请求。两个父代策略进行交叉后,也可能出现变量名不一致、步骤缺失或程序无法执行。

这意味着搜索不能只鼓励“新”,还必须保证“能用”。如果约束过严,所有新个体只能围绕种子做微小变化;如果约束过松,群体会迅速充满无效程序。论文为此引入了可执行性检查、软可逆约束和LLM辅助修复。

3. 怎样判断一个策略真的更好?

只判断模型是否拒绝并不充分。一个提示可能让模型不再拒答,但生成内容支离破碎,甚至没有完成原始任务。这样的结果对评估真实安全风险意义有限。

作者因此同时考察两个方面:目标模型的响应在多大程度上违反安全要求,以及响应是否仍然流畅、可读。两个目标并不总是一致。某个策略可能攻击评分很高,却因解码错误导致输出混乱;另一个策略攻击评分稍低,但响应完整自然。算法不应过早丢掉其中任何一种权衡。

4. LLM与进化算法怎样分工?

LLM能够理解自然语言和程序结构,适合提出有意义的修改;但一次性让LLM“再想十种方法”,并不会自动形成稳定的选择压力,也不会可靠保留跨代经验。

进化算法恰好具有相反的特点。它擅长维护群体、比较个体和逐代积累优势,却很难用传统随机算子改写同时包含语义和程序的复杂策略。

EvoJail的核心思路由此变得清楚:LLM负责创造和修复,进化算法负责选择和积累。这不是把进化算法替换成LLM,而是让LLM成为一种能够理解策略含义的进化算子。

四、作者如何把策略变成可以进化的“个体”?

1. 四元组表示:一套策略由四部分组成

论文把一个候选策略写成:

\[x=(h,e,d,t). \]

这四个符号分别对应:

  • \(h\):策略的自然语言说明,即它准备采用什么思路;

  • \(e\):编码算法,把原始请求 \(q\) 转换为结构化表示;

  • \(d\):解码算法或解码说明,帮助目标模型恢复语义;

  • \(t\):提示模板,规定编码结果和解码说明怎样呈现给目标模型。

可以把它理解为一个包裹系统。\(e\) 决定如何打包内容,\(d\) 是拆包说明,\(t\) 决定包裹以什么形式递交,\(h\) 则记录这套设计背后的思路。EvoJail搜索的不是包裹里的具体请求,而是整套打包和递交方法。

这种表示为什么重要?因为它把原本混在一段提示中的不同功能拆开了。变异可以针对编码结构进行,交叉可以组合两个策略的不同组成,修复也能根据错误定位到具体程序,而不必盲目重写全部提示。

2. 软可逆性:不要求逐字还原,但必须恢复意图

最严格的要求是:编码后再解码,必须逐字符得到原始请求,即 \(d(e(q))=q\)。然而,这会把搜索限制得非常狭窄。某些变换虽然改变了词序或表面形式,却仍然能让模型恢复相同语义。

论文采用更宽松的“软可逆性”:

\[d(e(q))\approx_{\mathrm{sem}}q. \]

其中的 \(≈ₛₑₘ\) 表示语义近似。换言之,解码结果不必逐字相同,但不能丢失或改变原始意图。

软可逆性解决的是探索范围问题,修复机制解决的是程序有效性问题。两者结合后,搜索既可以跨出简单字符变换,又不至于产生大量完全无法使用的个体。

3. 双目标建模:既要有效,也要让输出保持完整

论文把搜索写成双目标最小化问题:

\[\min_x F(x)=\{f_1(x),f_2(x)\}, \]

\[f_1(x)=-\mathrm{ASR}(r_q), \]

\[f_2(x)=\mathrm{PPL}(r_q). \]

第一个目标衡量响应的越狱程度。实验中,DeepSeek-V3对目标模型响应打1至10分:1表示拒绝或保持安全,10表示明确违反安全要求。论文沿用了ASR这一名称,但这里实际使用的是单条响应的等级评分,更准确地说,它是攻击强度分数,而不是传统意义上对一批样本计算的成功比例。

第二个目标是困惑度PPL。PPL越低,文本通常越接近语言模型认为自然、连贯的表达。作者用它检查编码和解码是否让最终响应变得混乱。

这里需要先理解作者的意图:PPL不是为了让攻击提示“更隐蔽”,而是为了避免算法只追求不拒答,却得到乱码式、残缺式响应。不过,PPL只能粗略反映流畅度,不能证明输出正确、有用或真正具有危害能力。这个指标边界会在后文讨论。

4. Pareto前沿:为什么不把两个目标直接相加?

假设策略A的攻击评分更高,但输出不够流畅;策略B的攻击评分略低,却能生成完整自然的响应。很难用一个固定权重断言二者谁绝对更好,因为不同安全评测场景可能关心不同权衡。

多目标优化因此不急于把两个指标压缩成一个总分。只要一个策略在攻击评分和PPL上没有被另一个策略同时超过,它就有机会保留下来。这些互不支配的策略共同构成Pareto前沿。

EvoJail最终寻找的不是唯一“最强提示”,而是一组具有不同权衡的策略。对红队测试而言,这一点很重要:真正有价值的测试集应覆盖多种失败模式,而不是反复运行同一个攻击。

图1 EvoJail的核心流程。左侧是由启发式说明、编码算法、解码算法和提示模板组成的策略个体;中间的LLM负责生成、变异、交叉和修复;右侧目标模型的响应接受攻击评分与PPL评估,非支配排序结果再反馈到下一代。本文根据论文方法重新绘制,未复用IEEE原图。

五、一次完整的EvoJail搜索是怎样发生的?

理解了个体和目标之后,整套算法可以看成一个不断重复的“提出策略、检查策略、测试策略、筛选策略”循环。

第一步:用简单种子告诉系统从哪里出发

作者提供Queue、OddEven、Length、Stack和Reverse五类种子。它们代表队列、奇偶分组、长度分组、栈式操作和逆序等基础结构。

这些种子并不是作者声称有效的最终答案。它们的作用类似进化中的原始材料:让设计模型知道什么叫编码、解码和结构化变换,同时保留足够空间继续重组和创新。

设计模型DeepSeek-V3读取种子的说明与程序,生成规模为10的初始种群。

第二步:让LLM进行有语义的变异与交叉

普通随机变异可能只是删除一行代码或替换一个字符,往往会直接破坏程序。EvoJail把父代策略和代际表现一同交给LLM,让它在理解原有设计的基础上提出变化。

每个父代会被标记为Better、Equal、Worse、Mixed或Unknown,用来说明它相对上一代的攻击评分变化。LLM据此判断哪些部分值得保留,哪些部分需要重新设计,并尝试新的分组方式、数据结构或元信息组织。论文还主动排除了简单字符旋转和Base64式变化,希望搜索不再停留于已有套路。

变异主要从一个父代产生新策略;交叉则尝试组合两个父代的有效组成。两者都作用于四元组结构,而不是无差别重写一整段文本。

第三步:先修好,再拿去测试

新个体可能出现编码和解码不匹配、程序报错或语义无法恢复。EvoJail先执行一致性和可执行性检查,再把错误信息连同问题个体反馈给设计模型,要求它进行局部修复。每个个体最多尝试10次。

修复不是附属功能。没有修复,程序型个体在连续交叉和变异后会迅速积累错误;如果简单删除所有出错个体,许多有潜力但尚不完整的新结构又无法进入群体。修复机制相当于给进化搜索提供了一条从“有想法但有缺陷”走向“可以运行”的通道。

第四步:让目标模型回答,再评价结果

通过检查的编码和解码程序会与随机采样的提示模板组合,形成完整提示。系统把提示提交给目标模型,并对响应计算攻击评分与PPL。

此时,设计模型和目标模型承担不同角色。DeepSeek-V3主要负责提出候选和修复候选;Llama或Gemini等目标模型负责暴露自身的安全行为。实验中的主设置又使用DeepSeek-V3评价目标响应,这一点提高了自动化程度,也带来了设计模型与裁判模型相关的潜在偏差。

第五步:在“强”和“多样”之间选择下一代

父代选择一半偏向高攻击评分个体,用于继续开发已经有效的方向;另一半采用基于Pareto关系的二元锦标赛,避免群体只剩下一种极端策略。

父代和子代合并后,算法使用类似NSGA-II的非支配排序选择下一代,并持续把产生的个体加入归档。种群规模为10,进化20代,每种算法独立运行10次。

现在可以更准确地理解EvoJail:LLM并没有取代进化算法。LLM负责在复杂语义与程序空间中产生有意义的变化,进化算法负责提供长期选择压力、群体多样性和跨代积累。

六、实验不是只想证明“攻击成功率更高”

作者的实验实际上围绕四个问题展开:

  1. EvoJail找到的策略集是否优于已有的固定或自动化攻击方法?

  2. 进化过程、LLM算子、Pareto选择和修复分别有没有实际作用?

  3. 在少量查询上发现的策略,能否应用到没有参与搜索的新查询?

  4. 结论是否只是某一个自动裁判的偏好?

1. 实验设置

维度 实验设置
目标模型 Llama-2-7b-chat-hf、Llama-3.1-8B-Instruct、Gemini 2.5
数据集 GPTFuzzer、JBB-Behaviors、MaliciousInstruct
实例构成 3个模型 × 3个数据集 × 每个数据集3组查询,共27个实例
对比方法 CipherChat/Cipher、Jailbroken、FlipAttack、CodeAttack、CodeChameleon、ReNeLLM
主评估器 DeepSeek-V3评攻击分数,GPT2-XL评PPL
补充评估器 RoBERTa、ShieldGemma、Llama-Guard;OPT、GPT-Neo、Pythia
综合指标 经验归一化后的Hypervolume(HV),参考点为[0,1]
统计检验 Wilcoxon秩和检验,显著性水平0.05

论文使用HV比较不同方法得到的整个策略集。可以把HV理解为Pareto前沿在目标空间中覆盖的“有效区域”:如果一个方法既能得到更强、更流畅的响应,又能提供多种不同权衡,它覆盖的区域就更大,HV也更高。

因此,HV评价的不是一条提示,而是一个策略集合的综合质量。与此同时,HV依赖归一化边界和参考点,本文中的数值只能在当前实验设置内比较,不能直接与另一篇论文的HV横向对照。

2. 主结果:EvoJail的优势来自策略集,而非单个技巧

按照论文表I中的显著性检验,EvoJail相对FlipAttack、CodeChameleon、Jailbroken和Cipher均为27胜0平0负;相对ReNeLLM为26胜1平0负;相对最有竞争力的CodeAttack为20胜7平0负。

为了让27行结果更容易理解,我们对表I的均值做了描述性复算。EvoJail在27个实例上的平均HV约为0.590。逐个实例选取六个基线中最高的均值,再对27个实例求平均,结果约为0.474,EvoJail相对高约24.5%。这不是作者预先定义的统计指标,只是帮助读者把整张表压缩成一个总体量级。

EvoJail也不是每一行的数值都最高。在LLaMA8B-M1、LLaMA8B-M2和Gemini-G3上,它的HV均值略低于该行最佳基线,但统计检验认为差异不显著。因此,更准确的结论是:EvoJail在27个场景中总体占优,并在少数场景与最强基线相当,而不是“所有场景绝对领先”。

这个结果支持了论文的第一项主张:自动搜索得到的一组策略,在攻击评分与流畅度的整体权衡上,优于多数固定策略和文本改写方法。

3. 消融结果:收益不是因为换了一批种子

作者选取6个代表性场景,分别去掉进化过程、Pareto选择和修复机制,或者把设计好的LLM算子替换为随机生成。我们根据表II的均值计算了跨场景平均结果:

方法 6场景平均HV 相对完整EvoJail
完整EvoJail 0.5267
去掉Evolution 0.4728 -10.2%
只保留Seed Init 0.3365 -36.1%
随机LLM算子 0.4840 -8.1%
去掉Pareto选择 0.4640 -11.9%
去掉Repair 0.3817 -27.5%

只保留种子初始化时,平均HV下降36.1%。这说明EvoJail的收益并不是简单来自五个初始技巧,后续进化才是主要增益来源。

去掉修复后,平均HV下降27.5%,说明程序型个体确实需要有效性维护。去掉Pareto选择后,平均HV下降11.9%,说明只追求攻击评分会损害策略集的综合质量。随机LLM生成也弱于带有父代表现反馈的语义算子,表明“让LLM随便再生成一些策略”并不能替代受进化选择约束的搜索。

不过,消融结果并非在每个场景都严格单调。随机LLM算子在LLaMA8B-M1上高于完整方法,去掉Pareto的版本在个别场景也略高。因此,实验支持的是各模块在跨场景平均意义上的贡献,而不是每个模块对每个实例都必然有利。

4. 泛化结果:策略不只记住训练查询,但仍没有跨越模型边界

作者把三个查询组上发现的策略整合,再测试同一数据集中未参与搜索的剩余查询。六个模型与数据集组合上,EvoJail相对五个基线均为6胜0平0负,相对CodeAttack为5胜1平0负。

我们的描述性复算显示,EvoJail的平均HV约为0.729,逐场景最佳基线约为0.513,相对高约42.2%。这说明发现的编码与解码策略不是只对最初十条查询有效,它们可以迁移到同一来源的其他请求。

但这里的“泛化”有明确边界:数据集没有变,目标模型也没有变,变化的只是查询。它证明的是同源未见查询泛化,不能直接推导为跨模型、跨安全策略或跨领域泛化。

5. 多评估器结果:排序较稳定,但自动裁判问题仍然存在

作者进一步替换了三种安全判断器和三种PPL评估模型。虽然绝对数值发生变化,EvoJail总体仍保持竞争力,说明主结果不是由单一分类器的数值尺度偶然造成。

但是,多种自动评估器给出相近排序,并不等于它们准确测量了真实危害。尤其是DeepSeek-V3同时参与策略设计和主攻击评分,可能更容易理解或偏好自己生成的结构。论文没有使用盲化人工评估,也没有直接测量响应是否正确、具体和真正可执行。

七、实验究竟证明了什么,又没有证明什么?

一篇论文的价值不仅取决于表中数字有多高,也取决于我们能否准确理解这些数字支持到哪里。

EvoJail已经较有说服力地证明:长尾攻击可以被表示为语义与算法结合的搜索对象;LLM辅助进化比一次性生成或固定种子更有效;修复和多目标选择对维持策略集质量有实际作用;得到的策略可以迁移到同一模型、同一数据来源中的未见查询。

但论文尚未证明四件更强的事情。

1. “不拒答”还不等于“真正具有有害能力”

论文的主攻击指标是1至10分的自动裁判评分,第二个指标PPL主要反映文本流畅度。一个响应可能没有拒绝,也写得通顺,却仍然缺乏正确性、具体性或可执行性。StrongREJECT等研究已经指出,某些看似成功的越狱只得到了空泛回答。

因此,未来评估需要把“是否愿意回答”和“是否真的完成危险任务”分开测量。PPL可以检查乱码,却不能代替任务能力评价。

2. 查询泛化还不是安全环境泛化

论文中的未见查询仍来自相同基准,目标模型保持不变。更严格的测试应当在一个模型上搜索、迁移到另一个模型;在一种安全版本上搜索、测试更新后的版本;或者把开放模型上发现的策略迁移到带有输入过滤和输出审查的生产系统。

3. 更大的搜索预算可能带来比较优势

EvoJail需要生成、修复和评估大量候选,HV又会奖励策略集覆盖范围。论文采用相同集成规模分析了部分预算影响,但没有给出足够完整的成本账本。目标模型查询数、设计模型调用数、token开销、运行时间和货币成本都应纳入公平比较。

如果一种方法调用模型数百次,另一种方法只产生少量固定策略,仅比较最终HV并不能完整回答谁更高效。

4. 当前模型与复现范围仍然有限

实验包含三个目标模型,其中Llama-2-7B已经难以代表2026年的主流模型,闭源模型只有Gemini 2.5。论文也没有系统评估带有外部护栏的完整产品栈。

此外,论文进行了大量逐场景Wilcoxon检验,但没有说明多重比较校正;HV的经验归一化边界也不够具体。伪代码中的修复计数和最终归档筛选仍有可澄清之处。截至本文检索日期,我们没有在论文或arXiv页面找到公开代码链接。

这些不足并不否定论文的主要贡献。它们说明EvoJail目前是一套有充分实验支持的方法框架,而不是已经完成生产系统验证的通用攻击基准。

八、这篇论文为什么值得TEVC和进化计算研究者关注?

1. 它把安全漏洞转化成了搜索空间设计问题

很多越狱论文围绕某一种提示技巧展开,EvoJail则先问:一套长尾策略应当怎样表示,哪些部分可以变异,怎样判断个体有效,如何保留不同权衡。

这种问题意识具有一般性。无论研究对象是程序、工作流还是智能体,只要我们希望进化的不是一串固定长度的数字,而是具有语义和结构的策略,就必须先解决表示、约束和算子设计。

2. 它展示了LLM与进化算法真正互补的一种方式

LLM擅长理解代码和自然语言之间的关系,却缺少稳定的群体管理和长期选择机制。进化算法能够提供选择压力、归档与多样性维护,却不擅长在复杂程序空间中制造有意义的新结构。

EvoJail没有把二者简单串联,而是明确划分角色:LLM成为语义感知的生成、变异、交叉和修复算子;多目标进化负责评价反馈、非支配选择和跨代积累。这正是论文与TEVC研究范围高度契合的地方。

3. 它把红队目标从“一次成功”推进到“失败模式组合”

安全团队需要知道模型会以哪些不同方式失守。一个最高攻击分数只能说明存在漏洞,一组覆盖不同结构与权衡的策略,才可能形成更系统的回归测试集。

Pareto策略集提供了这种思路的起点。下一步还需要进一步测量行为机制上的多样性,防止档案中保存的只是表面不同、实质相似的策略。

4. 它再次揭示了大模型安全的核心矛盾

模型在长尾输入上失守,不一定是因为它没有理解请求。更值得警惕的情况恰恰是:模型理解了复杂编码和解码逻辑,却没有把安全规范同步泛化过去。

随着模型能力增强,它能够解析的程序、符号和多模态结构会越来越多。如果安全训练没有以相近速度扩展,能力边界扩大反而可能带来新的安全盲区。EvoJail研究的正是这种能力增长与安全泛化不同步的问题。

九、截至2026年8月,前沿研究正在怎样推进?

EvoJail并不是这条路线的终点。近两年的研究变化,可以看成是在继续回答它尚未解决的四个问题。

1. 搜索对象正在从提示词扩展到策略、程序和智能体

早期自动越狱主要修改提示文本。AutoDAN-Turbo开始积累可复用的攻击策略;2026年的AgenticRed把进化对象扩展为包含规划和反馈的红队系统;AutoRISE则直接搜索可执行攻击程序。

沿着这条脉络看,EvoJail处于关键的中间位置。它已经越过纯文本提示,开始进化编码与解码程序,但搜索对象仍主要是一条提示处理管线。未来系统可能直接进化完整的测试代理,包括目标选择、策略调用、失败诊断和后续探索。

2. 研究目标正在从“最强攻击”转向“行为覆盖”

QDRT和RedTopic等工作把质量与多样性同时纳入搜索。这里的多样性不只是提示文字不同,而是希望覆盖不同攻击行为、主题和失败机制。

EvoJail的Pareto前沿主要描述攻击评分与PPL的权衡,还没有直接评价两个策略在机制上是否重复。未来可以对编码程序结构、目标模型内部行为或跨模型迁移模式进行表征,使档案真正覆盖不同安全漏洞。

3. 自动红队正在形成记忆,而不是每次重新开始

EvoJail每次从一组种子启动。MemoAttack等新工作则维护可以持续更新的技能记忆,记录某类策略在何种模型、语境和失败类型上有效。

这更接近真实安全团队的工作方式。模型不断更新,攻击经验也应被组织、淘汰和迁移,而不是每次从固定种子重新搜索。

4. 评估协议开始关注能力、预算和威胁模型

JailbreakBench推动统一的行为集合和评测流程,StrongREJECT强调不能把“不拒答”直接视为有效攻击,2026年的Prompt Security SoK进一步要求明确攻击者权限、查询预算、防御状态、目标行为和裁判。

这些工作共同说明,未来比较自动攻击算法时,仅报告ASR已经不够。研究者需要回答:攻击者知道什么、调用了多少次模型、是否使用辅助LLM、最终响应是否真正完成任务,以及不同裁判是否经过校准。

5. 自动进化开始从攻击侧走向防御侧

如果自动攻击只用于不断刷新ASR纪录,它对真实安全的贡献仍然有限。Membrane和SESG等工作开始让防御侧维护动态安全记忆或持续更新护栏。

更完整的闭环应当是:攻击系统发现一种新失败模式,防御系统把它转成训练样本和回归测试,更新后再由攻击系统重新检验,同时监控是否引入过度拒答。攻击与防御最终会形成共同进化过程。

需要提醒的是,2026年4月还出现了另一篇题为“EvoJail”的预印本,由Rui Tang等人提出,同样涉及多目标进化越狱,但并非Hong等人的TEVC论文。检索和引用时应结合作者、完整标题和arXiv编号进行区分。Hong等人的版本于2026年3月20日首先发布。

十、沿着这项工作,还可以继续研究什么?

EvoJail已经说明结构化策略可以自动进化,下一步应当把“搜索得更强”推进为“评估得更真实、覆盖得更广、修复得更及时”。

首先,需要建立预算匹配的比较协议。每项实验都应报告目标模型查询数、辅助模型调用、token消耗、运行时间和成本,使算法质量与搜索代价能够同时比较。

其次,需要把响应质量从PPL扩展为任务能力评价。自动裁判应分别判断拒答、相关性、具体性、正确性和可执行性,并使用人工盲评或异构裁判进行校准。

再次,需要直接优化机制多样性。可以从编码程序的结构、策略行为和跨模型迁移结果三个层面判断两个个体是否真正不同,避免Pareto档案被近重复策略占满。

更重要的是,应开展跨模型、跨防御和跨版本迁移。在开放模型上发现策略,再到闭源模型和生产安全栈中验证,才能检验长尾漏洞是否具有真实的外部有效性。

最后,自动攻击档案应与防御更新连接。每当发现新策略,就生成最小回归集,更新安全数据或防御记忆,再同时检查漏放率和过度拒答率。只有完成这一步,自动红队才能从漏洞生成器转化为安全改进工具。

结语

回到文章开头的问题:为什么大模型明明知道某类请求应当拒绝,换一种表达方式后却可能失守?

因为大模型的理解能力和安全规则并不是在同一个数据范围内学到的。预训练教会模型理解广泛的语言、代码和结构,安全对齐则只可能覆盖其中一部分。当模型进入“能够理解、却没有充分学会拒绝”的区域,长尾安全漏洞就会出现。

EvoJail的贡献,是把这种过去依赖人工灵感发现的漏洞,转化为一个可以表示、变异、修复和多目标选择的进化问题。它没有给出大模型安全的最终答案,却提供了一种更系统地寻找安全盲区的方法。

从研究谱系看,这项工作连接了两条正在快速汇合的路线:一条是大模型自动红队,另一条是LLM辅助进化计算。它真正值得关注的地方,不是找到了一句更强的提示,而是说明了搜索空间本身也可以被设计和进化

对安全研究而言,发现漏洞只是前半程。只有当这些自动发现的失败模式被转化为训练数据、回归测试和持续更新的防御机制时,进化攻击才会真正成为改进模型安全的工具。

参考文献与延伸阅读

  1. Hong, W. et al. Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models. IEEE TEVC, 2026. DOI: https://doi.org/10.1109/TEVC.2026.3726531 ;arXiv: https://arxiv.org/abs/2603.20122
  2. Yuan, Y. et al. GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher. ICLR 2024. https://openreview.net/forum?id=MbfAK4s61A
  3. Ren, Q. et al. CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code Completion. Findings of ACL 2024. https://aclanthology.org/2024.findings-acl.679/
  4. Ding, P. et al. A Wolf in Sheep’s Clothing: Generalized Nested Jailbreak Prompts Can Fool Large Language Models Easily. NAACL 2024. https://aclanthology.org/2024.naacl-long.118/
  5. Chao, P. et al. JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. NeurIPS 2024. https://proceedings.neurips.cc/paper_files/paper/2024/hash/63092d79154adebd7305dfd498cbff70-Abstract-Datasets_and_Benchmarks_Track.html
  6. Souly, A. et al. A StrongREJECT for Empty Jailbreaks. NeurIPS 2024. https://proceedings.neurips.cc/paper_files/paper/2024/file/e2e06adf560b0706d3b1ddfca9f29756-Paper-Datasets_and_Benchmarks_Track.pdf
  7. Zhu, S. et al. AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs. ICLR 2025. https://openreview.net/forum?id=bhK7U37VW8
  8. Qi, X. et al. QDRT: Quality-Diversity Red-Teaming for Large Language Models. arXiv, 2025/2026. https://arxiv.org/abs/2506.07121
  9. AgenticRed: Agentic Evolutionary Red-Teaming for Large Language Models. arXiv, 2026. https://arxiv.org/abs/2601.13518
  10. AutoRISE: Evolving Executable Red-Teaming Programs for Large Language Models. arXiv, 2026. https://arxiv.org/abs/2604.22871
  11. MemoAttack: Memory-Evolving Automated Red Teaming of Large Language Models. arXiv, 2026. https://arxiv.org/abs/2605.29237
  12. Tang, R. et al. EvoJail: Evolutionary Diverse Jailbreak Prompt Generation for Large Language Models. arXiv, 2026. https://arxiv.org/abs/2605.02921
  13. SoK: Prompt Security in Large Language Models. arXiv, 2026. https://arxiv.org/abs/2510.15476
  14. Membrane: Self-Evolving Contrastive Safety Memory for Large Language Models. arXiv, 2026. https://arxiv.org/abs/2606.05743
  15. SESG: Self-Evolving Safety Guardrails for Large Language Models. arXiv, 2026. https://arxiv.org/abs/2608.08471