当前位置: 首页 > news >正文

[论文学习]JBShield:通过激活概念分析与操纵防御大语言模型越狱攻击

JBShield: Defending LLMs from Jailbreak Attacks through Activated Concept Analysis and Manipulation (USENIX Security 2025)

论文重点

本文基于线性表征假说(Linear Representation Hypothesis, LRH),系统揭示了大语言模型越狱攻击的内在机制,并提出了一套名为JBShield的防御框架。该框架通过识别输入提示中是否同时激活了“有毒概念”和“越狱概念”来检测越狱攻击,并通过增强有毒概念、削弱越狱概念来操纵模型的隐藏表征,从而实现安全输出。实验表明,JBShield在五个开源LLM上对九种越狱攻击的平均检测F1-Score达到0.94,将平均攻击成功率从61%降至2%。

核心研究內容

问题定义

尽管大语言模型已通过RLHF等对齐策略嵌入了安全护栏,但它们仍然容易受到越狱攻击的威胁——攻击者通过巧妙构造的输入提示绕过安全机制,使模型输出本应被拒绝的有害内容。已有的防御方法或依赖表面模式检测,或采用固定拒绝输出策略,均未能从根本上理解越狱攻击为何能操纵模型行为。本文提出两个核心研究问题:RQ1——对齐后的LLM能否识别越狱提示中的有害语义?RQ2——越狱攻击如何将LLM的输出从拒绝转变为顺从?

创新方法

(一)概念分析与提取算法。基于线性表征假说——神经网络将高层概念编码为隐藏表征中的子空间——本文将有害提示和越狱提示中的有害语义定义为“有毒概念”(toxic concept),将越狱提示中操纵LLM顺从恶意请求的语义定义为“越狱概念”(jailbreak concept)。概念提取采用反事实配对方法:从两类提示中各取一个样本配对,计算其最后一词隐藏表征的差值矩阵,再通过截断奇异值分解(SVD,rank=1)提取主奇异向量作为概念子空间。该子空间还可通过输出嵌入矩阵映射为可读token进行解释。

(二)JBShield双组件防御框架。

  • JBShield-D(检测):通过单次前向传播,判断输入是否同时激活了有毒概念和越狱概念。具体而言,先将输入与良性样本比较提取“测试有毒概念”,与锚定有毒概念子空间进行余弦相似度比较;再提取“测试越狱概念”,与锚定越狱概念子空间比较。若两个概念均被激活,则判定为越狱提示。

  • JBShield-M(缓解):对于检测到的越狱提示,在隐藏表征层面进行操纵——增强有毒概念的锚定向量的同时削弱越狱概念的锚定向量。与现有方法输出固定拒绝内容不同,这使得LLM能够自主生成有针对性的安全内容。

(三)关键发现。概念分析揭示了两个重要结论:第一,对齐后的LLM能够识别越狱提示中的有害语义(有毒概念被激活);第二,越狱攻击并非绕过毒性检测,而是通过引入“越狱概念”这一新的语义成分来主动操纵模型的顺从行为。例如,Mistral-7B中IJP、GCG、PAIR等越狱方法对应的可解释token包括“understood”“sure”“yes”等顺从相关词汇。

研究成果

  • 检测性能:在五个开源LLM上针对九种越狱攻击,JBShield-D的平均F1-Score达到0.94。
  • 缓解性能:JBShield-M将平均攻击成功率从61%降至2%。
  • 数据效率:仅需30个越狱提示即可完成校准。
  • 效率优势:检测仅需单次前向传播,缓解仅涉及少量线性运算。

实际落地应用的可能性

JBShield具有较高的实际应用价值:首先,它仅需少量校准数据即可部署,适合快速适配新型越狱攻击;其次,它不要求白盒访问攻击者模型,仅依赖目标LLM自身的隐藏表征;最后,其概念可解释性(通过可读token展示)为安全运维人员提供了攻击意图的可视化分析能力。适用于需要高安全性保障的LLM部署场景,如金融、医疗、政务等领域的对话系统。

技术细节

1. 隐藏表征形式化

对于输入提示 x,第 l 层Transformer层的隐藏表征为:

Hl(x)=TFLayerl(Hl−1(x))H_l(x) = \text{TFLayer}_l(H_{l-1}(x))Hl(x)=TFLayerl(Hl1(x))

其中Hl(x)∈Rm×dH_l(x) \in \mathbb{R}^{m \times d}Hl(x)Rm×d,m为输入token数,d为嵌入维度。取最后一个token的隐藏表征ele_lel作为整句的句嵌入。

2. 概念提取(以有毒概念为例)

步骤一:反事实配对。设有害提示集Xh={xih}i=1NX^h = \{x^h_i\}^N_{i=1}Xh={xih}i=1N,良性提示集Xb={xib}i=1NX^b = \{x^b_i\}^N_{i=1}Xb={xib}i=1N,随机配对形成(xih,xib)(x^h_i, x^b_i)(xih,xib)

步骤二:线性分解。计算差值矩阵:

Dtoxic=[el(x1h)−el(x1b)el(x2h)−el(x2b)⋮el(xNh)−el(xNb)]D_{\text{toxic}} = \begin{bmatrix} e_l(x^h_1) - e_l(x^b_1) \\ e_l(x^h_2) - e_l(x^b_2) \\ \vdots \\ e_l(x^h_N) - e_l(x^b_N) \end{bmatrix}Dtoxic=el(x1h)el(x1b)el(x2h)el(x2b)el(xNh)el(xNb)

DtoxicD_{\text{toxic}}Dtoxic进行截断SVD(rank=1),取V矩阵的第一列 v 作为概念子空间。

步骤三:映射为可读token。使用输出嵌入矩阵WoeW_{oe}Woe

scores=Woe⊤⋅v\text{scores} = W^\top_{oe} \cdot vscores=Woev

取top-k token作为概念的可解释表示。

3. 检测与缓解

  • 检测:计算测试概念子空间与锚定概念子空间的余弦相似度,若同时超过阈值则判定为越狱。
  • 缓解H~=H+α⋅vtoxic−β⋅vjailbreak\tilde{H} = H + \alpha \cdot v_{\text{toxic}} - \beta \cdot v_{\text{jailbreak}}H~=H+αvtoxicβvjailbreak

研究设定

实验配置

  • 目标LLM:五个开源模型,包括Mistral-7B、Llama-2-7B等
  • 越狱攻击:九种攻击方法,涵盖人工设计(IJP)、优化型(GCG、SAA)、模板型(MasterKey、PAIR、TAP)、语言型(DrAttack、Puzzler)和编码型(Zulu、Base64)五大类
  • 评估指标:检测采用F1-Score,缓解采用攻击成功率(ASR)
  • 校准数据:仅需30个越狱提示

代码与数据

论文代码和数据集已开源:https://github.com/NISPLab/JBShield

综合分析

理论贡献。本文最核心的贡献在于从线性表征的角度为越狱攻击提供了可解释的机理分析。过往研究虽观察到有害与良性输入在隐藏表征上的差异并称之为“拒绝方向”,但本文进一步通过概念提取揭示了越狱攻击的双重概念激活本质——有毒概念和越狱概念可以同时存在,而越狱概念会覆盖有毒概念的警告效应,驱使模型从拒绝转向顺从。这种“叠加而非绕过”的视角,为理解越狱攻击的本质提供了新的理论框架。

方法创新。JBShield将检测与缓解统一在同一个概念分析框架下,避免了以往方法中检测和缓解相互割裂的问题。值得注意的是,JBShield-M通过操纵隐藏表征而非修改输入或输出,使模型能够自主生成安全内容而非输出固定拒绝模板——这在用户体验上是一个显著改进。此外,仅需30个校准样本即可部署的特性,使其在实际场景中具备快速适配新攻击的能力。

局限与展望。该方法依赖对目标LLM隐藏表征的访问,因此主要适用于开源模型或提供内部表征访问接口的闭源模型。对于完全黑盒的API模型,如何应用类似思路仍需进一步探索。此外,概念提取依赖于SVD的线性假设,对于高度非线性的语义特征可能存在表征不充分的问题。

实践应用建议

1. 部署场景选择。JBShield适用于对开源LLM进行安全加固的场景。如果您的应用基于Llama、Mistral等开源模型部署,可直接集成JBShield的检测与缓解模块。建议优先在金融客服、医疗咨询、政务问答等高风险场景中部署。

2. 校准数据准备。JBShield仅需30个越狱提示即可完成校准。建议从以下来源收集校准数据:(a)公开越狱数据集(如IJP);(b)针对自身业务场景的红队测试结果;(c)历史安全事件中记录的恶意输入。

3. 关键层选择。论文指出并非所有层对识别有毒概念和越狱概念贡献相同。部署时建议通过验证集选择最能区分正常与越狱输入的层,以优化检测精度和计算效率。

4. 与现有安全机制集成。JBShield可部署在现有安全过滤流程中作为补充层:先由规则或轻量级分类器快速过滤明显恶意输入,再由JBShield对可疑输入进行深度检测和缓解,以平衡安全性与响应速度。

5. 监控与迭代。利用JBShield概念提取的可解释性(映射为可读token),安全团队可定期分析新出现的越狱攻击所对应的概念token模式,及时发现新型攻击手法并更新锚定概念子空间。

参考资料来源

  • 原始论文:Zhang, S., Zhai, Y., Guo, K., Hu, H., Guo, S., Fang, Z., Zhao, L., Shen, C., Wang, C., & Wang, Q. (2025). JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation.34th USENIX Security Symposium. https://arxiv.org/abs/2502.07557
  • 代码仓库:https://github.com/NISPLab/JBShield
http://www.jsqmd.com/news/1407618/

相关文章:

  • 2026跨境出海企业必看:适合海外AI搜索优化的靠谱跨境GEO服务商推荐6家,实力评估与签约避坑指南 - U渠道
  • php substring PHP substring用不好,字符串截取直接让你怀疑人生
  • ssh隧道端口转发
  • 2026-08-16 闲话
  • VNC软件使用
  • 自注意力机制:从核心原理到YOLO视觉应用实战
  • openEuler SSH配置全攻略:从安全加固到故障排查
  • 2026年企业提升品牌行业地位,选战略咨询公司还是国家级品牌传播平台? - Top品牌推荐
  • 千问 LeetCode 3915. 距离至少为 K 的交替子序列的最大和 TypeScript实现
  • 彻底解决前后端分离本地开发跨域问题:CORS原理与三大实战方案
  • 第四章 进度管理:瓶颈才是真正的关键路径
  • AI率过高怎么高效降?2026年10款免费AIGC降重工具亲测有效附指南 - 降AI实验室
  • ffmpeg 初始化配置及基本概念与套路
  • 使用Docker Compose部署BookStack:构建私有知识库的完整实践指南
  • 2026靠谱的GEO优化服务商有哪些?6家适合各类企业做AI搜索优化的实力GEO公司甄选盘点,附合作避坑FAQ详解 - 商业大观
  • 电动车托运怕被坑?2026年打工人换城必看的靠谱攻略 - 快递物流资讯
  • 电商风控实战:618大促中对抗黑产的三层防御体系与AI攻防
  • Linux GNOME桌面远程控制:vino VNC服务端配置与安全实践指南
  • 斯坦福大学 CS336 Lecture 06 Kernel Optimization and Application of the Triton Framework
  • Cocos Creator开发实战:系统性错误排查与性能优化指南
  • 从范式到分库分表:数据库架构设计核心方法论全解析
  • 体式视频显微镜光源推荐:欧凯电子的PDOK显微镜光源视觉支架实力优选 - 变量人生001
  • 千问 LeetCode 3915. 距离至少为 K 的交替子序列的最大和 Rust实现
  • 题解:P8389 [COI 2021] Izvanzemaljci
  • 读懂数字化转型 | 数字化时代已经到来:你的企业,正在被谁“降维打击“?
  • 在线检测 vs 离线抽检:电机异音品控策略怎么选?
  • 论文AI率90%如何降至5%?2026年亲测DeepSeek四大降AI提示词(附详细指令) - 降AI实验室
  • 从ARP协议到Proxy ARP:网络地址解析原理、实战与安全深度解析
  • 论文AI检测不通过?2026年10款免费降AIGC工具一键高效降AI率达标 - 降AI实验室
  • JAVA去水印工具开发与应用指南