arXiv:2607.17779: MIND-Framework umgeht die Abwehr von Text-to-Image-Modellen mit einer Angriffserfolgsquote von 95,62 %
Dongdong Yang und Kollegen stellen das MIND-Framework vor, das den Jailbreak von Text-to-Image-Modellen als Inferenz über einen verborgenen Verteidigungszustand behandelt, mittels der Komponenten Multi-modal Judge, Defense Profiler und Meta-Memory-Modul. Bei Stable Diffusion v1.5 erzielt MIND eine Angriffserfolgsquote (ASR) von 95,62 % selbst gegen aktive Abwehrmaßnahmen, mit vergleichbaren Ergebnissen bei kommerziellen Systemen.