[论文学习]Prompt Infection:多智能体系统中的LLM间提示注入攻击
Prompt Infection:多智能体系统中的LLM间提示注入攻击
论文重点
本文揭示了一个比传统单智能体提示注入更为危险的攻击向量——LLM-to-LLM提示注入。作者提出了一种名为“Prompt Infection”的新型攻击方式,恶意提示能够在互联的智能体之间自我复制传播,其行为类似于计算机病毒,可导致数据窃取、诈骗、 misinformation 和系统级瘫痪,且传播过程高度隐蔽。
核心研究内容
问题定义
随着LLM能力不断增强,多智能体系统(Multi-Agent Systems, MAS)在现代AI应用中日益普及。然而,绝大多数安全研究聚焦于单智能体LLM的漏洞,而多智能体系统中的安全风险却鲜有探索。传统提示注入攻击通过外部内容中嵌入的恶意提示来劫持单个LLM执行非预期操作。那么,当多个LLM协同工作时,攻击能否从一个智能体“传染”到另一个?多智能体系统是否因其分布式架构而天然更安全?这些问题尚缺乏系统性的研究。
创新方法
论文的核心创新在于提出了Prompt Infection攻击范式,其关键机制包括四个核心组件:
- Prompt Hijacking(提示劫持):强制受害智能体无视其原始指令;
- Payload(载荷):根据智能体的角色和可用工具分配具体任务;
- Data(数据):一个共享笔记,随着感染提示在智能体间传递而顺序收集信息;
- Self-Replication(自我复制):确保感染提示传播到系统中的下一个智能体。
这一设计的精妙之处在于:它将多智能体系统中原本复杂的函数组合序列——f₁∘f₂∘…∘f_N(x)——在感染后坍缩为一个单一的递归函数,使整个系统陷入由感染主导的重复循环。
研究成果
实验揭示了几个令人警醒的发现:
自我复制的威力:在全局消息传递模式下,对于GPT-4o,自我复制感染的攻击成功率比非复制感染高出13.92%;而对于GPT-3.5,这一差距高达209%。在局部消息传递场景中,非复制感染甚至无法成功感染超过两个智能体,而自我复制感染是唯一能够规模化感染的方法。
更强模型≠更安全:GPT-4o在抵抗提示注入方面确实更强——它能忽略66%的自我复制攻击和54%的非复制攻击,而GPT-3.5仅能忽略9%和20%。但一旦被攻破,GPT-4o反而成为更危险的攻击者——其更高的精确度使其能更准确地执行恶意任务。这一悖论对整个行业“用更强模型提升安全性”的假设提出了根本性质疑。
社会模拟中的“流行病”:在智能体社会中,感染遵循逻辑斯蒂增长模式。在50个智能体的群体中,仅需约21.4%的交互轮次即可实现全员感染。更值得警惕的是,感染提示可以操纵记忆检索系统中的重要性评分——GPT-4o在受到操纵后会将感染提示的重要性从1.94直接提升到10.00,形成自我强化的反馈循环。
实际落地应用的可能性
这项研究的价值不仅在于揭示漏洞。对于正在或计划部署多智能体系统的组织,论文提供了可直接落地的防御思路。LLM Tagging作为一种轻量级防御——在智能体响应前添加“[AGENT NAME]:”标记以区分消息来源——本身效果有限(仅降低5%攻击成功率),但与Marking策略结合后可完全阻止所有攻击,与Instruction Defense结合可将攻击成功率降至仅3%。
技术细节
攻击机制的形式化描述
论文将多智能体系统的正常运作建模为函数的复合:初始时,每个智能体执行其独特任务 fᵢ(x),产生不同的输出。系统的正常行为可表示为:
F_normal(x) = f₁ ∘ f₂ ∘ … ∘ f_N(x)
当Prompt Infection成功实施后,这一复杂函数序列坍缩为:
F_infected(N)(x, data) = PromptInfection(N)(x, data)
即一个由感染主导的单一递归函数。这一形式化描述清晰地说明了攻击的本质:将分布式的智能协作降级为单点控制的递归循环。
实验配置
多智能体应用实验(Section 5.1):
- 测试了三种典型多智能体应用:Customer Support(客服)、Travel Booking(旅行预订)、Code Writing(代码编写)
- 每个应用包含3-5个智能体,每个智能体配备特定工具(如数据库访问、代码执行、外部API调用)
- 攻击类型复盖五种威胁:Scam(诈骗)、Malware(恶意软件)、Content Manipulation(内容操纵)、Data Theft(数据窃取)、Availability Attack(可用性攻击)
- 消息传递模式分为全局(所有智能体共享消息历史)和局部(仅直接交互的智能体共享)
社会模拟实验(Section 5.2):
- 构建了10、20、30、40、50个智能体的“LLM小镇”
- 智能体之间进行随机配对对话,每轮四次对话交换
- 记忆检索采用重要性、相关性和新鲜度三个维度的评分机制
LLM Tagging防御机制
LLM Tagging的核心思路极为简洁:在智能体响应前添加来源标记。但论文的关键洞见在于:单一防御措施远不足以应对威胁。下表总结了论文评估的防御策略及其效果:
| 防御策略 | 单独使用成功率 | 结合LLM Tagging后成功率 |
|---|---|---|
| Marking + LLM Tagging | 76% | 0% |
| Instruction Defense + LLM Tagging | — | 3% |
| Sandwich + LLM Tagging | — | 16% |
| LLM Tagging(单独) | 95% | 95% |
值得注意的是,Marking策略最初看似完美(0%攻击成功率),但作者很快设计出了绕过方法——通过在感染提示的每个词之间插入下划线来中和标记符号。这揭示了一个更深层的现实:在提示注入的攻防博弈中,没有一劳永逸的解决方案。
研究设定
硬件与软件配置
- LLM模型:主要使用GPT-4o和GPT-3.5 Turbo;初步测试也涉及Claude,但因计算成本未完成全面评估
- 记忆检索:采用OpenAI的embedding API计算相关性,使用最大内积搜索
- 智能体框架:实验涵盖了类似LangGraph、AutoGen和CrewAI的多智能体架构
评估指标
攻击成功率的判定标准为:系统最终是否被完全攻破——即最终智能体产生了恶意输出且能够隐藏感染提示。这一标准比简单的“是否执行了恶意指令”更为严格,因为隐蔽性是现实攻击中至关重要的能力。
综合分析
从“单点漏洞”到“系统性风险”的跃迁
这篇论文最深刻的贡献在于揭示了安全威胁的质变:在单智能体系统中,提示注入只是一个“漏洞”;而在多智能体系统中,它演变为一种可以自我复制的“病毒”。这种质变意味着安全防护的思维范式必须随之转变——不能仅关注“入口防护”,而需要建立系统级的隔离、检测和响应机制。
“更强模型悖论”的深远含义
GPT-4o更能抵抗攻击却也更危险这一发现,对AI安全领域具有警示意义。它表明模型能力的提升是一把双刃剑——更强的指令遵循能力既意味着更好地服从用户,也意味着在被劫持时更精确地执行攻击者的意图。这要求我们在评估模型安全性时,必须同时考量抵抗力(resistance)和被攻破后的破坏力(potential damage)两个维度。
多智能体系统的“阿喀琉斯之踵”
论文还揭示了一个容易被忽视的脆弱点:记忆检索系统。通过操纵重要性评分,单个感染提示可以形成自我强化的反馈循环。这提醒我们,多智能体系统的安全不能仅关注通信层,还需要深入审视记忆、规划和推理等认知基础设施的脆弱性。
防御的困境与出路
LLM Tagging与现有防御手段的组合有效,但作者也坦诚地指出:算法生成的提示可以绕过这些防御。这暗示了一个更深层的问题:基于规则和标记的防御终究会被自适应攻击所突破。未来的方向可能在于开发能够检测异常行为模式而非仅依赖内容过滤的防御系统,以及建立多智能体系统的运行时监控和隔离机制。
实践应用
对多智能体系统开发者的建议
分层防御:不要依赖单一防护手段。论文明确表明,组合使用LLM Tagging与Marking或Instruction Defense是最有效的策略。
最小权限原则:智能体的工具权限应严格限制。如果数据窃取攻击需要“代码执行能力”的智能体来外发数据,那么限制哪些智能体拥有代码执行权限就能缩小攻击面。
通信审计:在多智能体系统中记录和分析智能体间的消息模式。异常的通信模式(如某个智能体频繁向特定智能体传递“标记”内容)可能是感染的早期信号。
记忆系统加固:对记忆检索的重要性评分机制进行额外验证,避免单一LLM的决定成为系统弱点。
红队演练:在部署前模拟Prompt Infection攻击,测试系统的真实脆弱性。论文的攻击方法可以作为红队测试的起点。
对平台提供商的建议
LangGraph、AutoGen、CrewAI等框架的开发者应考虑在框架层面内置防御机制。例如,默认启用消息来源标记、提供智能体间通信的隔离选项、以及内置异常检测钩子。
对研究社区的建议
论文在局限性中指出了几个值得深入的方向:其他LLM家族(Claude、Llama、Gemini)的脆弱性评估、更复杂的多智能体架构中的感染传播、以及算法生成的对抗性提示对防御的绕过。这些方向对构建真正安全的多智能体系统至关重要。
参考资料来源
- 原始论文:Lee, D., & Tiwari, M. (2024). Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems.arXiv preprint arXiv:2410.07283. https://arxiv.org/abs/2410.07283
