arXiv:2607.17779: MIND okvir zaobilazi obranu text-to-image modela stopom uspješnosti napada od 95,62%
Dongdong Yang i suradnici predstavljaju MIND framework koji jailbreak text-to-image modela tretira kao zaključivanje o skrivenom obrambenom stanju, kroz komponente Multi-modal Judge, Defense Profiler i Meta-Memory modul. Na modelu Stable Diffusion v1.5 MIND postiže stopu uspješnosti napada (ASR) od 95,62% čak i uz aktivnu obranu, s usporedivim rezultatima na komercijalnim sustavima.
Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.
Što je MIND framework i kako generira adversarial promptove?
Dongdong Yang i suradnici u radu “Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models” (arXiv:2607.17779) predstavljaju MIND, okvir koji generiranje adversarial promptova tretira kao belief-state inference — zaključivanje o skrivenom, latentnom stanju obrambenog mehanizma modela. Jailbreak je tehnika zaobilaženja sigurnosnih filtera modela kako bi se generirao sadržaj koji bi inače bio blokiran, a adversarial prompt je tekstualni unos posebno oblikovan da tu obranu prevari. MIND se sastoji od tri komponente: Multi-modal Judge koji dekomponira povratnu informaciju iz odgovora modela, Defense Profiler koji iterativno ažurira uvjerenje o obrambenom mehanizmu i Meta-Memory modul koji dohvaća povijesno uspješne strategije napada.
Stopa uspješnosti napada od 95,62% na Stable Diffusion v1.5
Na modelu Stable Diffusion v1.5 MIND postiže Attack Success Rate (ASR), odnosno stopu uspješnosti napada, od 95,62% — i to čak uz razne konfiguracije obrane koje bi trebale spriječiti generiranje zabranjenog sadržaja. Autori navode usporedive rezultate i na komercijalnim text-to-image sustavima, što sugerira da problem nije ograničen samo na jedan open-source model.
Očekivana zaštita naspram stvarne probojnosti
Rezultat od 95,62% ASR stoji u oštroj suprotnosti s pretpostavkom da obrambeni mehanizmi pružaju pouzdanu zaštitu. Umjesto fiksnih, unaprijed pripremljenih promptova, MIND ih dinamički prilagođava na temelju povratne informacije iz samog modela, uči obrazac ponašanja obrane tijekom napada i tako zaobilazi čak i konfiguracije osmišljene posebno protiv poznatih napada.
Zašto je nalaz relevantan za sigurnost generativnih modela
Rad pokazuje da statički filteri i fiksne liste zabranjenih riječi ne mogu pratiti napadače koji obrambeni mehanizam promatraju kao sustav čije se skriveno stanje može zaključiti i iskoristiti. Nalaz upućuje na to da developeri text-to-image alata trebaju testirati obranu protiv adaptivnih, a ne samo statičkih napada.
Česta pitanja
- Što je MIND framework i kako generira adversarial promptove?
- MIND je okvir koji generiranje adversarial promptova, tekstualnih unosa oblikovanih da zavaraju sigurnosne filtere, tretira kao belief-state inference — zaključivanje o skrivenom stanju obrambenog mehanizma modela. Sastoji se od komponenti Multi-modal Judge (dekompozicija povratne informacije), Defense Profiler (iterativno ažuriranje uvjerenja o obrani) i Meta-Memory modula (dohvaćanje povijesno uspješnih strategija).
- Koliko je MIND uspješan protiv obrane text-to-image modela?
- Na modelu Stable Diffusion v1.5 MIND postiže Attack Success Rate (ASR), odnosno stopu uspješnosti napada, od 95,62% čak i uz razne konfiguracije obrane. Autori navode usporedive rezultate i na komercijalnim text-to-image sustavima.
- Zašto rezultat od 95,62% ASR predstavlja problem za sigurnost modela?
- Rezultat pokazuje da statički obrambeni mehanizmi ne pružaju pouzdanu zaštitu protiv napadača koji obranu promatraju kao sustav čije se skriveno stanje može zaključiti i dinamički iskoristiti, umjesto da se oslanjaju na fiksne, unaprijed pripremljene promptove.
📬 AI vijesti u tvoj inbox
Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.
Povezane vijesti
arXiv:2607.18086: Evidence-sufficiency prompt smanjuje pretjeranu sigurnost kliničkih LLM-ova, ali i točnost
OpenAI: zajednički rani nalazi s Hugging Faceom o sigurnosnom incidentu tijekom evaluacije AI modela
Sakana AI: Fugu-Cyber postiže 86,9% na CyberGym i 72,1% na CTI-REALM testu, usporedivo s GPT-5.5-Cyber