论文阅读 CVPR 2026 Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak
总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894
Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks
https://openaccess.thecvf.com/content/CVPR2026/papers/Cong_Anchoring_the_Mind_of_Multimodal_Reasoners_Cognitive_Bias_as_a_CVPR_2026_paper.pdf
CVPR | LLM锚定效应越狱攻击
📄 论文信息
该论文题为《Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks》,作者Linhua Cong、Bingrui Sima和Kun He来自华中科技大学。该论文研究模型的认知安全:模型识别出危险意图后,仍可能用“教育用途”等理由将其合理化。
🚨 发现痛点
以往研究常从图像扰动、文字隐藏或推理链劫持入手。该论文发现,更深层的风险是模型“看出危险,却被开头带偏”。这类似心理学中的锚定效应,第一条信息会成为后续判断的参照。
🛠️ 提出方案
该论文提出RA-Attack。方法先输入结构化跨模态安全锚点,包括安全思维导图,以及要求模型在教育场景下解读导图的文字。随后,危险意图被写成前述分析的自然延伸,使模型沿着已建立的“安全轨道”继续推理。
💡 例子:
这像检查员先看到一份专业的安全培训材料,便认定任务合规。材料末尾再加入不合规要求,却写成培训案例的下一步。若检查员过度依赖最初印象,就可能把后续风险也误判为合理。RA-Attack利用的正是这种“先入为主”。
🔍 实验发现
该论文在AdvBench和Hades上测试七个闭源与开源模型。第一,RA-Attack在AdvBench上对Gemini-2.5-Pro和GPT-4o的攻击成功率达到92%和82%。第二,在o4-mini上,该方法仍达到44%,其他基线最高不超过12%。第三,三个代表模型的成功攻击回答中,超过95%会先合理化危险意图,再输出不安全内容。
🛡️ 防御与启示
该论文提出Anchor Debiasing Prompt,要求模型独立检查请求各部分。它将GPT-4o上的攻击成功率从82%降至8%,将Gemini-2.5-Pro从92%降至28%,且未损害MM-Vet通用能力。
📌 一句话总结
该论文表明,LLM安全不仅要审查输入和答案,也要防止推理过程被认知偏差牵引。
