
AI安全处于一个技术早期阶段,因此我们推出一个全新的“顶会顶刊AI安全论文研读”系列,方便全行业同仁和有志于从事AI安全的新生代学习理解最新技术与行业发展动态,本次为大家带来的是CVPR 2025 highlight | 分散即关键:一种基于“子图像对比分散”策略的多模态大模型越狱攻击研究。
这是第一期回顾:顶会顶刊AI安全论文研读第一期:ICCV 2025 | 基于启发式诱导的多模态风险分解越狱攻击方法:突破MLLMs安全防线
作者介绍
本文作者来自广州大学、阿德莱德大学与上海交通大学等单位。作者团队聚焦多模态大语言模型(MLLM)安全性研究,提出并系统评估了一种新的越狱攻击框架 CS-DJ(Contrasting Subimage Distraction Jailbreaking)。
导读
近年来,多模态大语言模型(MLLMs)在融合文本与视觉理解方面取得了巨大进步,但其安全机制背后也隐藏着新的漏洞。[1] 传统的“越狱”攻击(Jailbreak Attacks)往往通过构造包含有害内容的图像来欺骗模型,然而随着模型防御能力的提升,这类直接攻击的成功率正在下降。
本文颠覆了这一思路,提出了一种全新的攻击框架——对比子图分心越狱(CS-DJ)。该方法的核心思想不再是直接“投毒”,而是“分散其注意力”。研究发现,相比于图像内容本身,视觉输入的复杂度才是绕过模型安全机制的关键。基于这一“分心假说”(Distraction Hypothesis),CS-DJ通过构造复杂的多层级视觉输入,成功“过载”模型的安全检测模块,诱使其生成有害内容。
l 结构化分心:将一个有害的文本提问分解为多个子问题,并将这些子问题转化为图像,从而打散原始的有害意图。
l 视觉增强分心:在输入中额外拼接多个与主题无关、但视觉上形成强烈对比的无害图像,进一步加剧模型的处理负担。
大量的实验证明,CS-DJ在攻击包括GPT-4o、GPT-4V和Gemini-1.5-Flash在内的多种主流闭源MLLMs时表现出优异的性能。其平均攻击成功率(ASR)达到了52.40%,在某些模型上的提升幅度超过50%。这项工作揭示了MLLMs防御机制中的一个根本性弱点,为未来的模型安全研究提供了全新的视角,且本工作对应的论文已开源。

【论文题目】Distraction is All You Need for Multimodal Large Language Model Jailbreaking
【论文链接】https://arxiv.org/abs/2502.10794
研究背景
多模态大语言模型(MLLMs),如GPT-4o、Claude-3.7和Gemini-2.0,通过融合视觉和语言能力,在图像理解、视觉问答等任务上展现了非凡的性能。然而,这些模型继承了其视觉编码器的脆弱性,容易受到对抗样本的攻击。对抗样本通过在原始图像上添加人眼难以察觉的微小扰动,就能诱导模型产生错误的输出。
对抗攻击分为非靶向攻击(旨在使模型输出错误)和靶向攻击(旨在使模型输出特定的目标内容)。对于无法访问模型内部结构和参数的黑盒场景(尤其是商业闭源模型),实现高效的靶向迁移攻击极具挑战性。
这意味着,在一个或多个替代模型(surrogate models)上生成的对抗样本,需要能够成功欺骗一个完全未知的黑盒目标模型。尽管现有工作已证明了这种攻击的可行性,但其迁移成功率,特别是针对最先进的闭源MLLMs时,仍有很大的提升空间。
多模态大语言模型(MLLMs)如GPT-4o,能够同时处理和理解文本与图像信息,这极大地扩展了AI的应用场景。为了防止这些模型被用于生成不当或有害内容,研究人员通常会采用基于人类反馈的强化学习(RLHF)等技术进行安全对齐。
然而,这些安全机制并非坚不可摧。“越狱攻击”就是指通过精心设计的输入来绕过这些防护措施的行为。当前针对MLLMs的越狱攻击主要集中在构造“分布外”(Out-of-Distribution, OOD)的视觉输入上,例如生成带有恶意信息的图片。但随着模型见过的图像数据越来越多,构造出真正能骗过模型的OOD图像变得极具挑战性。
动机和理论分析
现有攻击方法通常假设,要让模型输出有害内容,输入的图像也必须包含某种程度的“有害性”。然而,本研究通过实验发现,真正起作用的并非图像的内容,而是复杂度。
这引出了本文的核心——“分心假说”(Distraction Hypothesis):当向MLLM输入一个由多个子图构成的复杂图像时,会显著增加模型的处理负担。这种“过载”会削弱模型的防御机制,使其更容易产生意料之外的(有害)输出。
相比于直接让模型“看”一张有害图片,CS-DJ采用的策略是让模型去理解一张看起来“杂乱无章、令人困惑”的合成图。这张图包含了多个不相关的视觉元素和由子问题转化的图像,其内在的复杂性和不连贯性分散了模型的注意力,使其安全检测模块难以聚焦和识别原始的有害意图,从而成功实现越狱。

图1: CSDJ与其他攻击对比示意图
方法
本节从整体框架出发,分三步详细介绍CS-DJ(Contrasting Subimage Distraction Jailbreaking)的设计思路:① 结构化分散(Structured Distraction / query decomposition);② 视觉增强分散(Visual-Enhanced Distraction / multi-subimage construction);③ 复合输入与越狱执行(composite image + prompt 执行)。

图2: CSDJ攻击样本生成流程
1)总体框架与设计直观(图示说明)
CS-DJ的总体流程如图 2所示:先用辅助模型G将原始有害查询Q拆分为若干子查询,再把子查询转为可视化子图(以“文本图像”或检索到的图片作为子图),随后检索并挑选与原查询以及彼此“最不相似”的对比性子图(contrasting subimages),把这些子图按网格组合成最终的复合图像Icomp,并与一个“看似无害”的多段提示P一起送入受害 MLLM。
2) 结构化分散:查询分解(Structured Distraction)
为打散文本端的对齐信号,CS-DJ 使用一个辅助分解模型G将原始查询Q分解为m个子查询


随后把每个子查询通过变换函数T(·)转为对应的“文本图像”或可视化片段(例如论文中用 Super Moods 字体渲染文本并保存为图片):

这种把文本碎片以视觉化子片段呈现的做法,一方面改变了模态(text→image),另一方面在输入中制造了“结构性分散”(模型需同时处理多条并列任务),从而降低模型对单一有害意图的聚焦能力。论文在消融实验中指出,适度的分解(例如m=3)能显著提高总体越狱成功率。
3) 视觉增强分散:多子图像构造与检索(Visual-Enhanced Distraction)
将视觉端的分散最大化是 CS-DJ 的核心。论文把问题简化为一个图像检索问题:先用 CLIP 将查询编码为密集向量

然后从图像集合D中检索与查询最不相似(最“对比”)的图像作为首个子图:

为保证子图之间也彼此对比(即互相分散),论文采用逐步检索的近似策略:在检索第j个子图时同时考虑与查询与已选子图的相似度累加项,形式化为:

通过该策略,选出的k个子图在语义向量空间上尽量远离原查询并互相远离,从而构建出高“互相干扰”的视觉组合。
子图组合与排版细节(工程上的若干实现点)
论文为复合图像保持相对稳定的纵横比与编码能力,采用固定列数(如 3 列)并通过增加行数控制子图数量;子图渲染分辨率与字体渲染细节(子查询文本作为图像时用 Super Moods、红色 50pt 字体;每个子图网格渲染为 500×500 像素)也在实现细节中列出,这些实现细节对最终效果有显著影响(参见论文附录的实验设定)。
4) 复合输入构成与越狱执行(Jailbreaking Execution)
将构造好的k个检索子图与m个文本化子图组合得到最终复合图像:

最终把Icomp与精心设计的“无害”指令P一起输入 MLLM:

提示 PPP 在论文中被分为三段:role-guiding(设定角色/场景)、task-guiding(要求同时完成多个子任务以分散注意力)、visual-guiding(提示“可能有其它图像有用”以进一步误导)。
5) 分散度量:Distraction Distance(度量分散程度的公式)
为量化构建的复合输入在向量空间中的“分散性”,论文提出了 Distraction Distance 指标。将查询与所有子图视为N个节点,每个节点用 CLIP 编码向量vi表示,则 Distraction Distance 计算为所有节点两两 L2 距离之和:

该度量同时反映节点数量与节点间的成对差异性——值越大表示整体输入在语义空间中越“分散”。论文通过实验证明:在保持其他条件不变时,Distraction Distance 与越狱成功率(ASR)总体呈正相关。
实验效果
核心实验结果对比

表1:CS-DJ与基线方法Hades在四种闭源MLLM上的攻击成功率和集成攻击成功率对比
表1展示了CS-DJ框架与基线方法Hades在四种闭源多模态大模型(GPT-4o-Mini、GPT-4o、GPT-4V、Gemini-1.5-Flash)上的攻击表现。
CS-DJ的平均攻击成功率(ASR)达到52.40%,集成攻击成功率(EASR)达74.10%,显著超越Hades的37.20%和62.75%。其中Gemini-1.5-Flash对CS-DJ攻击最敏感(ASR 53.2%),而GPT-4V在Hades测试中防御最强(ASR 42.3%)。值得注意的是,通过多次尝试的集成攻击策略使CS-DJ的EASR提升21.7%,证明其攻击鲁棒性。
消融实验

表2:查询分解数量对攻击成功率的影响
如表2所示,论文系统测试了将原始有害查询分解为不同数量子查询(3/6/9个)时对GPT-4o攻击成功率的变化。实验表明,分解为6个子查询时攻击效果最优(平均ASR 45.26%),较未分解的原始查询提升30.72%;但过度分解至9个子查询会因任务复杂度超出模型处理能力导致ASR下降至41.86%,揭示结构化干扰需在注意力分散与语义连贯性间取得平衡。

表3:视觉子图像选择策略的干扰效果对比
此表对比了三种视觉子图像构建策略:使用单一相似图像(9SinSI)、9张相似图像(9SSI)和9张对比图像(9CSI)。结果显示,采用对比性子图像的9CSI策略以54.0%的ASR显著领先,其干扰距离(24.9)是相似图像策略的1.6倍。该实验证实最大化视觉元素差异性是分散模型安全机制的关键,例如在隐私类攻击中,同时输入风景图与建筑照片产生的认知冲突可有效掩盖文本危害性。

表4:噪声图像与信息复杂度的影响验证
如表4所示,通过对比噪声图像(9RNI)与对比性子图像(9CSI)的攻击表现,该表指出噪声图像因信息复杂度不足,其ASR(34.8%)接近无视觉干扰的基线(34.1%),远低于9CSI的54.0%。这一结果反向论证了论文核心假设——只有高复杂度的视觉内容才能有效分散模型注意力,单纯增加图像数量而无信息密度无法突破安全防线。

表5:多级指令组合的协同增强效应
如表5所示,论文量化了指令设计中三个组件的增量贡献:仅任务引导时ASR为42.3%,加入角色引导(如设定模型为"安防顾问")后提升至50.0%,最终结合视觉误导提示(声称子图像含关键线索)时ASR达54.0%。这种阶梯式增长证明角色设定制造认知偏差、虚假视觉线索诱导注意力转移的策略,能协同强化模型对有害内容的盲区。
结语
本文提出基于注意力分散假设的CS-DJ框架,通过查询分解与对比子图像的双路径干扰策略,成功突破多模态大模型安全防线。实验证明该方法在GPT-4o等主流模型上实现52.40%平均攻击成功率,揭示视觉复杂度引发的注意力分散是安全防御的关键裂缝。该研究警示:高复杂度多模态输入可能瓦解RLHF对齐机制,为黑盒越狱攻击提供新范式。
我们是一家由顶级安全专家、全球知名算法科学家、专家资深红队研究员和全栈创造力出类拔萃开发者共同创立的新型安全公司,致力于打造全球领先的大模型算法安全检测平台与防御系统。
我们的使命是:
确保AI在安全、道德、合规的框架下运作,始终为人类社会服务。
我们相信真正的 AI 安全不是补丁,而是一套完整且可信赖的社会机制、工具链和能力体系。我们邀请你加入,一起写下这一章。
布兰矩阵将继续以技术为矛,倡议为盾,在国家战略框架指导下,为中国算法安全走向工程化、标准化、全球化,贡献开源力量。
欢迎有志的你参与我们的“BraneMatrix AI全球实习生计划”!
本文分享自 BraneMatrix布兰矩阵 微信公众号,前往查看
如有侵权,请联系 cloudcommunity@tencent.com 删除。
本文参与 腾讯云自媒体同步曝光计划 ,欢迎热爱写作的你一起参与!