🟡 🛡️ 安全 发布于: · 1 分钟阅读 ·

arXiv:2607.17779: MIND框架以95.62%的攻击成功率绕过text-to-image模型的防御

arXiv:2607.17779 ↗

展示MIND框架生成对抗性提示词以绕过text-to-image模型防御的示意图

Dongdong Yang及其合作者提出了MIND框架,将text-to-image模型的越狱(jailbreak)视为对隐藏防御状态的推断,通过Multi-modal Judge、Defense Profiler和Meta-Memory模块实现。在Stable Diffusion v1.5模型上,即便防御机制处于激活状态,MIND仍达到95.62%的攻击成功率(ASR),在商业系统上也取得可比结果。

🤖

本文由人工智能基于一手来源生成。

MIND框架是什么,如何生成对抗性提示词?

Dongdong Yang及其合作者在论文「Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models」(arXiv:2607.17779)中提出了MIND,一个将对抗性提示词生成视为belief-state inference——即对模型防御机制隐藏的潜在状态进行推断——的框架。越狱(jailbreak)是绕过模型安全过滤器以生成本应被屏蔽内容的技术,而对抗性提示词则是专门设计用来欺骗这种防御的文本输入。MIND由三个组件构成:分解模型响应反馈信息的Multi-modal Judge、迭代更新对防御机制判断的Defense Profiler,以及检索历史上成功攻击策略的Meta-Memory模块。

在Stable Diffusion v1.5上达到95.62%的攻击成功率

Stable Diffusion v1.5模型上,MIND达到95.62%的攻击成功率(Attack Success Rate,ASR)——即便在本应阻止生成违禁内容的多种防御配置下依然如此。作者表示在商业text-to-image系统上也取得了可比的结果,这表明该问题并不局限于单一的开源模型。

预期防护与实际可攻破性的对比

95.62%的ASR结果与「防御机制能提供可靠保护」这一假设形成鲜明对比。MIND并非依赖固定的、预先准备好的提示词,而是根据模型自身的反馈信息动态调整提示词,在攻击过程中学习防御的行为模式,从而绕过那些专门针对已知攻击设计的配置。

该发现为何与生成式模型的安全性相关

该论文表明,静态过滤器和固定的违禁词列表无法应对将防御机制视为可推断并可利用其隐藏状态的系统的攻击者。这一发现提示,text-to-image工具的开发者需要针对自适应攻击(而非仅仅是静态攻击)来测试自身的防御能力。

常见问题

MIND框架是什么,如何生成对抗性提示词?
MIND是一个将对抗性提示词(旨在欺骗安全过滤器的文本输入)生成视为belief-state inference(对模型防御机制隐藏状态的推断)的框架。它由三个组件构成:Multi-modal Judge(分解反馈信息)、Defense Profiler(迭代更新对防御的判断)和Meta-Memory模块(检索历史上成功的策略)。
MIND对text-to-image模型防御的攻破成功率有多高?
在Stable Diffusion v1.5模型上,MIND即使在多种防御配置下,仍达到95.62%的攻击成功率(Attack Success Rate,ASR)。作者表示在商业text-to-image系统上也取得了可比的结果。
为何95.62%的ASR结果对模型安全构成了问题?
该结果表明,静态防御机制无法为应对将防御视为可推断并动态利用其隐藏状态的攻击者提供可靠保护,而不能仅仅依赖固定的、预先准备好的提示词。

📬 AI 新闻直达您的邮箱

按您的方式定制每日摘要——自选主题、来源和频率,一键退订。