论文标题

Visual Adversarial Examples Jailbreak Aligned Large Language Models 视觉对抗样本越狱对齐的大型语言模型

论文链接

Visual Adversarial Examples Jailbreak Aligned Large Language Models 视觉对抗样本越狱对齐的大型语言模型论文下载

论文作者

Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, Prateek Mittal

内容简介

本文探讨了将视觉信息整合到大型语言模型(LLMs)中的安全和安全风险。研究指出,视觉输入的连续性和高维性使其成为对抗性攻击的薄弱环节,扩大了视觉集成LLMs的攻击面。此外,LLMs的多功能性为视觉攻击者提供了更广泛的对抗目标,超越了单纯的错误分类。通过案例研究,作者展示了如何利用视觉对抗样本绕过已对齐LLMs的安全防护,迫使模型遵循有害指令并生成有害内容。研究强调了追求多模态所带来的对抗风险,并将神经网络的对抗性脆弱性与AI对齐领域联系起来。

分点关键点

1.攻击面的扩大

视觉输入的整合使得LLMs面临更大的攻击风险。视觉输入空间的连续性和高维性使其容易受到视觉对抗样本的攻击,这些攻击难以防御,从而扩大了攻击面。

2.安全故障的扩展影响

LLMs的多功能性使得攻击者能够实现更广泛的对抗目标,不仅仅是错误分类,还包括越狱模型、诱发毒性或启用滥用等,影响范围更广。

3.案例研究

作者通过优化视觉对抗样本图像,成功绕过了对齐LLMs的安全防护,使模型遵循有害指令并生成有害内容。这些对抗样本不仅局限于优化时使用的语料库范围,还能诱发模型生成更广泛的有害内容。

4.对商业模型的影响

研究表明,类似的多模态攻击风险也适用于商业/专有视觉语言模型(VLMs),如OpenAI的GPT-4V。OpenAI在开发过程中也注意到了这种威胁,并实施了相应的缓解措施。

5.防御措施的分析

尽管对抗训练和鲁棒性认证等防御措施取得了一定进展,但对于现代LLM规模的模型来说成本过高,且大多数防御措施依赖于离散类别,难以应用于具有开放式输出的LLMs。输入预处理防御措施如DiffPure在实践中更易应用,但其对复杂自适应攻击的鲁棒性尚不清楚。

论文代码

代码链接:GitHub链接

AAAI2024论文合集:

AAAI2024论文合集

希望这些论文能帮到你!如果觉得有用,记得点赞关注哦~ 后续还会更新更多论文合集!!

更多推荐