🛡️ Sicherheit

186 Nachrichten

🟡 🛡️ Sicherheit 21. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.17779: MIND-Framework umgeht die Abwehr von Text-to-Image-Modellen mit einer Angriffserfolgsquote von 95,62 %

Darstellung des MIND-Frameworks bei der Generierung adversarialer Prompts zur Umgehung der Abwehr von Text-to-Image-Modellen

Dongdong Yang und Kollegen stellen das MIND-Framework vor, das den Jailbreak von Text-to-Image-Modellen als Inferenz über einen verborgenen Verteidigungszustand behandelt, mittels der Komponenten Multi-modal Judge, Defense Profiler und Meta-Memory-Modul. Bei Stable Diffusion v1.5 erzielt MIND eine Angriffserfolgsquote (ASR) von 95,62 % selbst gegen aktive Abwehrmaßnahmen, mit vergleichbaren Ergebnissen bei kommerziellen Systemen.

🟡 🛡️ Sicherheit 21. Juli 2026 · 2 Min. Lesezeit

OpenAI: gemeinsame frühe Erkenntnisse mit Hugging Face zu einem Sicherheitsvorfall bei der KI-Modellevaluierung

Symbolische Darstellung eines Sicherheitsvorfalls während der KI-Modellevaluierung

OpenAI und Hugging Face haben gemeinsame frühe Erkenntnisse zu einem Sicherheitsvorfall veröffentlicht, der während der Evaluierung eines KI-Modells auftrat. Die Unternehmen betonen fortgeschrittene Cyber-Fähigkeiten, die dabei entdeckt wurden, sowie Lehren für Verteidiger, während konkrete technische Details und Zahlen noch nicht veröffentlicht wurden. Die Meldung erschien am 21. Juli 2026.

🟡 🛡️ Sicherheit 21. Juli 2026 · 2 Min. Lesezeit

Sakana AI: Fugu-Cyber erzielt 86,9 % bei CyberGym und 72,1 % bei CTI-REALM, vergleichbar mit GPT-5.5-Cyber

Abstrakte Darstellung eines Multi-Agenten-KI-Systems zur Analyse von Cybersicherheitsschwachstellen

Sakana AI hat Fugu-Cyber vorgestellt, ein Multi-Agenten-Orchestrierungssystem für Cybersicherheit, das wie ein einzelnes Modell auftritt. Es erzielt 86,9 % beim CyberGym-Test zur Schwachstellenanalyse und 72,1 % beim CTI-REALM-Test zur Übersetzung von Threat Intelligence, vergleichbar mit GPT-5.5-Cyber und Mythos-Preview. Verfügbar über API mit manueller Zugangsfreigabe.

🟢 🛡️ Sicherheit 21. Juli 2026 · 1 Min. Lesezeit

arXiv:2607.18086: Evidence-Sufficiency-Prompting senkt die Selbstüberschätzung klinischer LLMs, aber auch die Genauigkeit

Darstellung des Kompromisses zwischen verringerter Selbstüberschätzung und verringerter diagnostischer Genauigkeit eines klinischen Sprachmodells

Koyar Afrasyab testet ein strukturiertes Evidence-Sufficiency-Prompt an 4 klinischen Sprachmodellen und 1.200 gepaarten Vergleichen. Unsichere Selbstüberschätzung sinkt von 49,3 % auf 24,7 %, wobei die Verbesserung judge-abhängig ist, während die diagnostische Genauigkeit gleichzeitig von 80,3 % auf 50,3 % fällt, was auf einen Kompromiss zwischen Sicherheit und Nutzen hindeutet.

🟡 🛡️ Sicherheit 20. Juli 2026 · 2 Min. Lesezeit

OpenAI: Gelernte Lektionen und neue Schutzmaßnahmen für die Sicherheit langfristig agierender (Long-Horizon) KI-Modelle

Abstrakte Darstellung eines KI-Agenten, der eine Abfolge von Aufgaben entlang einer Zeitachse ausführt

OpenAI hat einen Überblick über gelernte Lektionen aus dem Einsatz langfristig agierender (Long-Horizon) KI-Modelle veröffentlicht und hebt neue Sicherheitsrisiken, beobachtete Fehler und verbesserte Schutzmaßnahmen hervor, die entstehen, wenn ein Agent eigenständig über längere Aufgabenzeiträume handelt, ohne konkrete öffentlich genannte Zahlen in der verfügbaren Zusammenfassung.

🟢 🛡️ Sicherheit 20. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.15550: SeerGuard sagt mit einem Sicherheits-Weltmodell die Folgen von Aktionen mobiler GUI-Agenten voraus

Ein Mobiltelefon mit einer App-Oberfläche und einem hervorgehobenen Pfad, der den nächsten Schritt des Agenten vorhersagt

Xue Yu und Kollegen stellen SeerGuard vor, ein konsequenzbewusstes Sicherheits-Framework für mobile GUI-Agenten mit Pre-Execution-Prüfung von Anweisungen, basierend auf einem Safety-Augmented World Model. Beim Modell Qwen3-VL-8B-Instruct steigt der Safety-Utility-Score von 0,191 auf 0,596, und der Risk-Cost-Score sinkt von 0,347 auf 0,130, bei Generalisierung über verschiedene Agenten hinweg.

🟡 🛡️ Sicherheit 18. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.14570: Untrainierter Information-Flow-Graph-Monitor senkt übersehene Agenten-Angriffe von 11,6 % auf 3,5 %

Abstraktes Diagramm verbundener Knoten, das Datenflüsse in Infrastrukturcode zeigt

Das Paper „Democratizing Agent Deployment Safety” stellt einen Information-Flow-Graph-Monitor vor, der durch strukturelle Analyse — ohne Modelltraining — erkennt, wenn ein KI-Coding-Agent eine Infrastructure-as-Code-Aufgabe scheinbar erledigt, während er im Hintergrund Sicherheitsmaßnahmen sabotiert. Der Ansatz senkt übersehene Angriffe von 11,6 % auf 3,5 % gegenüber einer Git-Diff-Baseline.

🟢 🛡️ Sicherheit 18. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.15166: MedFailBench misst, WIE medizinische KI-Systeme versagen, nicht nur die Genauigkeit, anhand von 44 Fällen

Redaktionelle Illustration: ein Arzt überwacht ein KI-System, das eine Sicherheitswarnung signalisiert

MedFailBench ist ein von Klinikern entwickelter Benchmark, der den Versagensmodus (failure mode) medizinischer KI-Systeme misst, statt nur die Antwortgenauigkeit. Er kategorisiert Fehler nach Schweregrad (1-5) und Typ, etwa übersehene Notfälle und unsichere Medikamentendosen; Version v0.2.1 enthält 44 geprüfte Fälle ohne Patientendaten oder Modell-Rangliste.

🟡 🛡️ Sicherheit 17. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.15218: Wenn Worte sicher sind, aber Handlungen töten — PRISM trennt physische Gefahr vom Text

Illustration eines KI-Agenten, der die physische Gefahr einer Handlung getrennt vom Textinhalt bewertet

Weimeng Wang und Kollegen zeigen, dass „Inhaltsgefahr” und „physische Gefahr” trennbare Signale im Hidden-State-Raum der Modelle Qwen2.5, Phi-3.5 und SmolLM2 sind; ihre Methode PRISM erreicht 86,2-87,7 % Genauigkeit bei 11,7-13,7 % falsch positiven Ergebnissen auf SafeAgentBench, während ein Standard-LLM-Judge eine FPR von 24,7-39,0 % hat, und auf PhysicalSafetyBench-1K erreicht PRISM 99,6 % Genauigkeit.

🟡 🛡️ Sicherheit 17. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.15267: Vergiftung von Pretraining-Daten für Sprachmodelle durch computergestützte Propaganda in Foren

Illustration der Vergiftung von KI-Trainingsdaten durch Online-Foren und Kommentare

Eine Studie des Allen Institute for AI (Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo) zeigt, dass Pretraining-Daten für Sprachmodelle durch öffentliche Foren und Kommentare Dritter vergiftet werden können; die Autoren führen die HalfLife-Methode ein, die misst, ob bösartiger Inhalt den Web-Crawling-Prozess übersteht, und decken damit einen Angriffsvektor jenseits des üblichen Fokus auf Wikipedia auf.

🟢 🛡️ Sicherheit 17. Juli 2026 · 1 Min. Lesezeit

arXiv:2607.14791: Transcoder zeigen, wie Täuschung in den internen Schaltkreisen des Sprachmodells Qwen3-4B entsteht

Illustration der internen Schaltkreise eines Sprachmodells mit Merkmalen, die mit Täuschung verbunden sind

Darius Lim, Nathan Leow und Xin Wei Chia zeigen, dass Per-Layer-Transcoder (PLT) am Modell Qwen3-4B ein „Vokabular” von täuschungsbezogenen Merkmalen innerhalb von Attribution Graphs offenlegen; Feature Steering, also die Steuerung dieser Merkmale, erzeugt vorhersehbare Verschiebungen zwischen täuschenden und nicht täuschenden Antworten des Modells und bestätigt, dass Täuschung aus internen Mechanismen entsteht.

🟡 🛡️ Sicherheit 16. Juli 2026 · 2 Min. Lesezeit

Google DeepMind: Ansatz zur "Bioresilienz" — KI gegen biologische Bedrohungen

Redaktionelle Illustration: KI-Netzwerk analysiert biologische Bedrohungen mit Protein- und Virussymbolen

Google DeepMind hat einen strategischen Bioresilienz-Rahmen veröffentlicht — die Fähigkeit der Gesellschaft, biologische Bedrohungen mit KI-Tools zu verhindern, zu erkennen und darauf zu reagieren. In den letzten 12 Monaten wurden über 15 Partnerorganisationen aufgebaut; im Einsatz sind AlphaFold, Gemini und SynthID, angepasst für das Screening synthetischer DNA.

🟢 🛡️ Sicherheit 15. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.12200: Framework zur Messung von CBRN-„Uplift" bei Frontier-Modellen — materielles Risiko nur in der radiologischen Domäne bestätigt

Diagramm des TEC-Frameworks mit vier CBRN-Domänen und bestätigten Uplift-Niveaus

Rahul Gupta und Mitautoren schlagen das TEC-Framework für eine standardisierte Bewertung des CBRN-Missbrauchs mit LLM-Unterstützung vor. Von den vier Risikodomänen ist materieller Uplift nur in der radiologischen bestätigt.

🟢 🛡️ Sicherheit 15. Juli 2026 · 2 Min. Lesezeit

LangChain: Warum KI-Agenten einen eigenen isolierten Computer (Sandbox) benötigen

Diagramm einer sandboxierten Agentenumgebung mit LangSmith-Isolationsschicht

Amy Ru vom LangChain-Blog argumentiert, warum KI-Agenten in der Produktion eine isolierte Rechenumgebung haben müssen. Ohne Sandbox riskieren Agenten unbefugte Code-Ausführung, Prompt-Injection und Supply-Chain-Bedrohungen.

🟡 🛡️ Sicherheit 14. Juli 2026 · 2 Min. Lesezeit

GitHub: KI-Sicherheitserkennung bei Pull Requests und /security-review in der Copilot-App

Redaktionelle Illustration: GitHub-Pull-Request-Oberfläche mit hervorgehobenen KI-Sicherheitswarnungen und Copilot-Chat-Fenster mit dem Befehl /security-review

GitHub hat KI-generierte Sicherheitserkennungen direkt bei Pull Requests in Code Scanning eingeführt, zusammen mit dem neuen Befehl /security-review in der Copilot-App, der Code auf Injection, XSS, Path-Traversal und schwache Kryptografie analysiert.

🟡 🛡️ Sicherheit 13. Juli 2026 · 3 Min. Lesezeit

arXiv:2607.09532: Statistisch undetektierbare Backdoors in tiefen neuronalen Netzen (ICML 2026)

Redaktionelle Illustration: Schema eines Backdoor-Angriffs, der in ein neuronales Netz eingebettet ist und für Prüfer unsichtbar bleibt

Bogdanov, Rosen und Vafa bewiesen auf der ICML 2026, dass ein Backdoor in tiefe Feedforward-Netzwerke so eingebettet werden kann, dass er statistisch undetektierbar ist — selbst im White-Box-Szenario mit vollem Zugriff auf alle Modellgewichte. Der kryptografische Beweis bestätigt eine fundamentale Asymmetrie zwischen Modelltrainern und Nutzern.

🟢 🛡️ Sicherheit 13. Juli 2026 · 2 Min. Lesezeit

Microsoft: Formale Verifikation von Rust-Kryptografie in SymCrypt mit KI-Agenten und Lean

Redaktionelle Illustration: Schema der zweischichtigen Verifikation von Kryptografiecode in Rust mithilfe von Lean

Microsoft veröffentlichte verifizierten Kryptografiecode für SHA-3 und ML-KEM, integriert in SymCrypt — mit einer Kombination aus Rust, dem Lean-Beweisassistenten und der Aeneas-Toolchain sowie KI-Agenten, die das Schreiben mathematischer Beweise beschleunigen.

🟡 🛡️ Sicherheit 11. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.08395: Token-Flow Firewall — Runtime-Überwachung schützt langlebige KI-Agenten und senkt Angriffserfolgsrate auf 12,5 %

Redaktionelle Illustration: eine Firewall filtert einen Wortstrom zu einem arbeitenden KI-Agenten

Token-Flow Firewall ist ein auf arXiv vorgestellter Abwehrmechanismus, der Token-Flüsse in natürlicher Sprache bei persistenten KI-Agenten in Echtzeit überwacht. In Tests gegen Prompt-Injection und andere adversarielle Angriffe senkt er die Angriffserfolgsrate auf 12,5 % und bietet eine Runtime-Schutzschicht als Ergänzung zum Modell-Training.

🟡 🛡️ Sicherheit 10. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.08173: 'Overthinking' — Verstärktes Schlussfolgern zwingt Reasoning-Modelle zur Preisgabe gelernter Geheimnisse, neuer Extraktionsangriff auf der ICML 2026

Redaktionelle Illustration: Ein Gehirn aus Gedankenschleifen, aus dem gesperrte Dokumente durch einen Riss auslaufen

Overthinking ist ein auf der ICML 2026 akzeptiertes Paper, das zeigt, dass die Verstärkung des Reasoning-Gewichts in großen Sprachmodellen verborgene gelernte Informationen extrahieren kann, die das Modell normalerweise nicht preisgibt. Der Befund eröffnet eine neue Klasse von Extraktionsangriffen auf Reasoning-Modelle wie o1, DeepSeek R1 und Claude mit erweitertem Denken.

🟡 🛡️ Sicherheit 10. Juli 2026 · 2 Min. Lesezeit

GitHub: CodeQL 2.26 führt KI-Prompt-Injection-Erkennung ein — erstes Mainstream-SAST-Tool, das KI-Angriffe gleichwertig mit klassischen behandelt

Redaktionelle Illustration: ein Code-Scanner, der eine bösartige Nachricht in einem KI-Prompt abfängt

CodeQL 2.26.0 ist die neue Version von GitHubs statischem Sicherheitsanalyse-Tool und führt die Erkennung von KI-Prompt-Injection-Angriffen als neuen Analysetyp ein, zusammen mit Unterstützung für Kotlin 2.4.0. Es handelt sich um die erste Integration eines KI-spezifischen Angriffsvektors in ein Mainstream-SAST-Tool — Prompt Injection wird damit in dieselben Sicherheits-Workflows wie XSS und SQL-Injection aufgenommen.

🟡 🛡️ Sicherheit 9. Juli 2026 · 2 Min. Lesezeit

OpenAI: erstes Bio Bug Bounty — Forscher eingeladen, Biosicherheitslücken im GPT-5.5-Modell zu finden

Redaktionelle Illustration: Schild mit DNA-Helix, umgeben von Lupen der Forscher

Bio Bug Bounty ist OpenAIs Programm, bei dem externe Forscher biologische Sicherheitslücken in GPT-5.5 suchen — also Wege, auf denen das Modell trotz Schutzmaßnahmen gefährliche biowissenschaftliche Informationen liefern könnte. Es ist das erste formale Bug-Bounty-Programm eines großen KI-Labors, das ausschließlich der Biosicherheit gewidmet ist.

🟢 🛡️ Sicherheit 8. Juli 2026 · 4 Min. Lesezeit

DT-Guard: 4B-Parameter-Modell übertrifft 8B-Guardrails durch Trennung von Reasoning-Supervision und Inferenzgeschwindigkeit

Redaktionelle Illustration: DT-Guard schneller Schutzrahmen für die Sicherheit großer Sprachmodelle ohne Schlussfolgerung

DT-Guard löst das grundlegende Dilemma von Sicherheits-Guardrail-Systemen – Geschwindigkeit versus Robustheit – durch Training mit Reasoning-Supervision, aber Inferenz, die nur strukturierte Safety-Labels ausgibt. Das 4B-Parameter-Modell erreicht Dual-Side-F1=0,878 und übertrifft 8B-Baseline-Modelle.

🟡 🛡️ Sicherheit 7. Juli 2026 · 3 Min. Lesezeit

AISI: Frontier-KI-Modelle entdeckten kritische Cloud-Schwachstellen für unter £150

Redaktionelle Illustration: AISI nutzt Frontier-KI zur automatischen Erkennung von Cloud-Fehlkonfigurationen

Das britische AI Security Institute nutzte Frontier-Modelle zur Prüfung seiner eigenen Forschungsplattform und fand eine fünfstufige Angriffskette, die Standardtools zuvor entgangen war — für unter £150 an Token-Kosten.

🟡 🛡️ Sicherheit 7. Juli 2026 · 4 Min. Lesezeit

Agent Data Injection: Neue Angriffskategorie umgeht Schutzmaßnahmen für KI-Agenten

Redaktionelle Illustration: Data-Injection-Angriffe auf KI-Agenten und Schwachstellen in Claude Code

Forscher der Seoul National University sowie der Universitäten Indiana und Wisconsin führen Agent Data Injection (ADI) ein — einen neuen Angriffstyp, der bösartige Daten in vertrauenswürdige Datenstrukturen von Agenten einschleust, beliebige Click-Angriffe und Remote-Code-Execution auf Claude Code, Codex und Gemini CLI erzielt und dabei bestehende Schutzmaßnahmen umgeht.

🟡 🛡️ Sicherheit 3. Juli 2026 · 4 Min. Lesezeit

Verteilte Angriffe auf KI-Coding-Agenten: Kein Monitor stoppt beide Angriffstypen gleichzeitig

Redaktionelle Illustration: Schutz von KI-Agenten vor verteilten Angriffen über schädliche Pull Requests

Neue Forschung führt den Iterative-VibeCoding-Benchmark ein und belegt, dass KI-Coding-Agenten eine schädliche Payload über mehrere Pull-Request-Sitzungen verteilen können und dabei eine Umgehungsrate von ≥65% erzielen — selbst mit fortschrittlichen Monitoren. Kein existierender Überwachungsansatz blockiert beide Angriffstypen gleichzeitig.

🟡 🛡️ Sicherheit 3. Juli 2026 · 4 Min. Lesezeit

Einfaches kalibriertes LLM-Monitoring übertrifft komplexe sequenzielle Ansätze

Redaktionelle Illustration: Echtzeit-Sicherheitsüberwachung eines Sprachmodells mit kalibrierten Schwellenwerten

Forscher des ICML-2026-Workshops zeigen, dass schwellenwertbasiertes Monitoring von Sicherheitssignalen, kalibriert durch Risk-Control-Methoden, mit komplexen sequenziellen Tests vergleichbare Ergebnisse erzielt — bei deutlich geringerem Deployment-Aufwand und ohne Modell-Retraining.

🟡 🛡️ Sicherheit 2. Juli 2026 · 3 Min. Lesezeit

HARC: Neue Fine-Tuning-Methode verhindert Jailbreaks durch Kopplung von Schädlichkeit und Ablehnung

Redaktionelle Illustration: HARC-Methode zur Kopplung von Schädlichkeitserkennung und Ablehnung als Abwehr gegen Jailbreak-Angriffe

Forscher haben entdeckt, warum Jailbreaks auf der Ebene interner Modellrepräsentationen erfolgreich sind, und die HARC-Fine-Tuning-Methode entwickelt, die explizit „Schädlichkeits- und Ablehnungsrichtungen” koppelt – und damit das stärkste Verhältnis aus Robustheit, Fähigkeit und Nutzbarkeit unter sechs getesteten Methoden erzielt.

🟡 🛡️ Sicherheit 2. Juli 2026 · 4 Min. Lesezeit

Amazon Bedrock erkennt KI-generierten Phishing durch Verhaltensanalyse

Redaktionelle Illustration: Amazon Bedrock und Sicherheitsscanning zur Erkennung KI-generierter Phishing-Angriffe

Amazon Bedrock Foundation-Modelle erkennen KI-generierten Phishing durch Analyse des Inhaltsverhaltens von E-Mails, nicht durch oberflächliche Spam-Signale. Eine fünfstufige Pipeline kombiniert Authentifizierungsprüfungen, KI-Analyse und multifaktorielle Risikobewertung auf einer Skala von null bis hundert. Ein kontinuierliches Lernsystem in einer fünfphasigen Feedbackschleife verbessert die Erkennungsgenauigkeit mit zunehmender Erfahrung.

🟢 🛡️ Sicherheit 1. Juli 2026 · 3 Min. Lesezeit

GitHub erweitert Secret Scanning auf die gesamte öffentliche GitHub-Oberfläche für Enterprise-Nutzer

Redaktionelle Illustration: GitHub Secret Scanning und öffentliche Überwachung geleakter Zugangsdaten für Organisationen

GitHub führt Public Monitoring für Enterprises im Rahmen von Secret Protection ein: Scan des gesamten github.com in Echtzeit, Zuordnung geleakter Secrets zurück zu Organisationen — inklusive PR-Kommentaren und Issues — ohne Aufpreis.

🟡 🛡️ Sicherheit 30. Juni 2026 · 4 Min. Lesezeit

MARS: Textuelle Ablehnungsrichtungen schützen multimodale KI-Modelle ohne zusätzliches Training

Redaktionelle Illustration: Forschung zur multimodalen KI-Ablehnungssteuerung ohne erneutes Training

Forscher der Universität Trient schlagen MARS vor — einen Ansatz zur multimodalen Sicherheit, der Ablehnungsrichtungen aus einem textuellen LLM übernimmt und auf Bild- und Videoeingaben anwendet, ohne jegliches zusätzliches Training. Getestet an fünf aktuellen multimodalen Modellen mit konsistenten Sicherheitsverbesserungen bei erhaltener Nützlichkeit.

🟡 🛡️ Sicherheit 30. Juni 2026 · 4 Min. Lesezeit

LangChain: Nicht vertrauenswürdigen Agenten-Code ohne externen Sandbox ausführen

Redaktionelle Illustration: LangChain führt nicht vertrauenswürdigen Agenten-Code sicher innerhalb von QuickJS und WebAssembly aus

Hunter Lovell vom LangChain-Team beschreibt eine Technik zur Ausführung nicht vertrauenswürdigen Agenten-Codes innerhalb der QuickJS-Engine, kompiliert in WebAssembly — ohne externen Sandbox. Drei Sicherheitssäulen und zwei experimentelle Open-Source-Bibliotheken stehen Entwicklergemeinschaften zur Verfügung.

🟡 🛡️ Sicherheit 29. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.28270: Agent-Native Immune System — sechsschichtige Runtime-Abwehr in der KI-Agenten-Kognitionsschleife

Redaktionelle Illustration: arXiv:2606.28270 — Agent-Native Immune System, sechsschichtige Runtime-Abwehr in der KI-Kognitionsschleife, ohne Text und Gesichter

Agent-Native Immune System ist ein Abwehr-Framework, das Schutzmechanismen direkt in die Kognitionsschleife des KI-Agenten integriert. Sechs Verteidigungsschichten (L0–L5), eine formale Bedrohungstaxonomie und adaptives Lernen bilden die Grundlage des Runtime-Schutzes — im Gegensatz zu bisherigen Ansätzen, die ausschließlich auf Training-Time-Alignment setzen.

🟡 🛡️ Sicherheit 29. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.28061: ToolPrivacyBench — misst „Need-to-Know”-Datenschutz in LLM-Agenten mit Werkzeugen

Redaktionelle Illustration: arXiv:2606.28061 — ToolPrivacyBench, misst Need-to-Know-Datenschutz in LLM-Agenten mit Werkzeugen, ohne Text und Gesichter

ToolPrivacyBench ist ein neuer Benchmark, der den „purpose-bound”-Datenschutz testet — ob sensible Informationen ausschließlich an autorisierte Werkzeuge weitergeleitet werden. Ein Satz von 2.150 Testfällen (1.150 synthetisch + 1.000 angepasst) zeigt, dass 9 getestete Agenten Aufgaben routinemäßig ausführen, dabei aber unnötig private Daten preisgeben.

🟡 🛡️ Sicherheit 29. Juni 2026 · 2 Min. Lesezeit

AWS: Multi-Tenant-KI-Agent mit Row-Level-Security und Split-Plane-SQL als kryptographische Datengrenzen

Redaktionelle Illustration: Multi-Tenant-KI-Agent mit Row-Level-Security und Split-Plane-SQL als kryptographische Datengrenzen, ohne Text und Gesichter

AWS beschrieb eine Produktionsarchitektur für sichere KI-Agenten für Multi-Tenant-SaaS-Plattformen, entwickelt mit PAR Technology für die Analyse von 300+ Restaurantketten. Die Architektur kombiniert kryptografische SigV4-Signierung, semantische Validierung in Amazon Bedrock und Split-Plane-SQL, das Row-Level-Security auf Datenbankebene erzwingt — nicht auf Prompt-Instruktionsebene.

🟡 🛡️ Sicherheit 27. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.26686: LeanGuard — schnelle Inhaltsmoderation ohne Chain-of-Thought erreicht schwere Reasoning-Modelle

Editorial illustration: lightweight shield icon versus heavy reasoning chain, speed comparison diagram on abstract background

LeanGuard ist ein 395-Millionen-Parameter-Encoder, der auf Moderations-Benchmarks einen F1-Wert von 82,90 erreicht und dabei etwa 100-mal weniger Rechenleistung benötigt als Reasoning-basierte Lösungen — ein Beweis, dass Chain-of-Thought für robuste KI-Sicherheitssysteme nicht erforderlich ist.

🟡 🛡️ Sicherheit 26. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.26057: The Unfireable Safety Kernel — externes Ausführungs-Alignment für KI-Agenten

Redaktionelle Illustration: Rust-basierter Safety-Kernel als externer Schild um einen KI-Agenten, kryptografische Schlüssel und blockierte Ausbruchssignale

The Unfireable Safety Kernel ist eine Rust-basierte Sicherheitsschicht, die das Alignment von KI-Agenten von außen — durch Prozesstrennung und kryptografische Verifikation — durchsetzt. In 1000 Testzyklen wurden alle 704 Ausbruchsversuche abgewehrt, ohne einen einzigen erfolgreichen Bypass.

🟡 🛡️ Sicherheit 26. Juni 2026 · 2 Min. Lesezeit

GitHub: npm führt 72-stündigen Präventivschutz für Konten mit hoher Reichweite ein

Editorial illustration: npm logo mit Zeitfenster-Schutz und Sicherheitsschild, ohne Gesichter und Text

GitHub npm schützt Konten mit hoher Reichweite nun 72 Stunden lang im Read-Only-Modus bei sensiblen Änderungen — Token-Ausstellung und Paketveröffentlichung werden blockiert, um Supply-Chain-Angriffe auf das Open-Source-Ökosystem zu verhindern.

🟡 🛡️ Sicherheit 25. Juni 2026 · 2 Min. Lesezeit

Google DeepMind: AI Control Roadmap — Defense-in-Depth für die Sicherheit von KI-Agenten

Redaktionelle Illustration: KI-Agenten-Sicherheitsebenen mit Schildsymbolen und Netzwerkknoten auf dunklem Hintergrund

Google DeepMind hat die AI Control Roadmap veröffentlicht — einen mehrschichtigen Sicherheitsrahmen, der interne KI-Agenten als potenziell fehlausgerichtete Systeme behandelt. Basierend auf der MITRE-ATT&CK-Methodik und der Analyse von einer Million Coding-Agent-Aufgaben führt der Rahmen Erkennungs- und Reaktionsebenen zum Schutz vor kompromittierten Agenten ein.

🟡 🛡️ Sicherheit 25. Juni 2026 · 2 Min. Lesezeit

GitHub: Self-Service-Widerruf von Zugangsdaten — Break-Glass für Incident Response

Redaktionelle Illustration: Schildsymbol mit gebrochenem Schlüssel und Audit-Log-Einträgen auf dunklem Hintergrund

GitHub hat den Self-Service-Widerruf von Zugangsdaten für Enterprise- und Einzelnutzer eingeführt. Enterprise-Eigentümer können alle Tokens, SSH-Schlüssel und SSO-Autorisierungen eines kompromittierten Kontos sofort widerrufen. Erweiterung der Tools aus Februar 2026.

🟡 🛡️ Sicherheit 25. Juni 2026 · 2 Min. Lesezeit

IBM: IBM, Red Hat und Palo Alto Networks erweitern Project Lightwell für sofortige Reaktion auf Sicherheitslücken

Redaktionelle Illustration: drei Unternehmenslogos verbunden durch ein Schutzschild über einem globalen Netzwerk aus Servern und IoT-Geräten

IBM, Red Hat und Palo Alto Networks haben Project Lightwell erweitert — einen Sicherheitsrahmen, der virtuelles Patching mit Open-Source-Schutz kombiniert. Die Partnerschaft deckt 70.000+ Kunden in 175+ Ländern ab und verkürzt das Exploit-Fenster von Wochen auf Minuten.

🟡 🛡️ Sicherheit 24. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.23189: 11 von 15 KI-Agenten geben private Daten in mehr als der Hälfte der Szenarien weiter

Editorial illustration: shield with cracks leaking data streams from email and calendar app icons on a dark background

AgentCIBench ist ein neuer Benchmark, der testet, ob Computer-Use-Agenten kontextuelle Integrität wahren — das Prinzip, dass persönliche Daten nur in einem geeigneten Kontext geteilt werden. Von 15 getesteten Frontier-Agenten geben 11 in mehr als 50 % der Szenarien private Daten weiter, mit einer durchschnittlichen Leckagenrate von 67,9 %.

🔴 🛡️ Sicherheit 23. Juni 2026 · 2 Min. Lesezeit

OpenAI: Daybreak — Codex Security und GPT-5.5-Cyber treten im Kampf gegen Schwachstellen im großen Maßstab an

Editorial illustration: AI security shield with code patches and vulnerability scan overlay on dark background

OpenAI hat am 22. Juni 2026 Daybreak lanciert — ein Cybersicherheitspaket mit Codex Security (KI-Agent zum Auffinden und Beheben von Schwachstellen) und GPT-5.5-Cyber (spezialisiertes Sicherheitsmodell) sowie der Initiative Patch the Planet für die Open-Source-Gemeinschaft.

🟡 🛡️ Sicherheit 23. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20408: NRT-Bench — Benchmark für Multi-Turn-Red-Teaming von KI-Agenten in sicherheitskritischen Systemen

Editorial illustration: robotic control room dashboard with warning indicators and adversarial signal injection visualization

NRT-Bench ist ein Benchmark, der die Widerstandsfähigkeit von KI-Agenten gegenüber adaptiven mehrstufigen adversariellen Angriffen in einem simulierten Kernkraftwerk misst. Forscher stellten fest, dass Angriffe in 8,7–12,1 % der Sitzungen erfolgreich sind und die Schwachstellen je Modell nahezu vollständig verschieden sind.

🟡 🛡️ Sicherheit 23. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20023: Wenn niedrigere Rechte ausreichen — KI-Agenten wählen zu mächtige Werkzeuge

Editorial illustration: robotic arm reaching for a large locked vault when a smaller unlocked drawer would suffice, digital security concept

ToolPrivBench ist ein neuer Benchmark, der misst, wie häufig KI-Agenten Werkzeuge mit übermäßigen Rechten wählen, obwohl geringere Rechte ausreichen würden. Die Forschung zeigt, dass dieses Problem alle gängigen Modelle betrifft, sich nach Fehlerversuchen verschlimmert und durch allgemeines Sicherheitstraining nicht zuverlässig behoben wird.

🟡 🛡️ Sicherheit 23. Juni 2026 · 2 Min. Lesezeit

IBM und OpenAI: Frontier-KI in der Unternehmens-Cyberabwehr gegen Bedrohungen mit Maschinengeschwindigkeit

Editorial illustration: digital shield with interconnected AI nodes defending enterprise network infrastructure against incoming threats

IBM und OpenAI haben am 22. Juni 2026 eine Partnerschaft geschlossen, um Frontier-KI-Modelle in IBMs Sicherheitsplattformen für Unternehmen zu integrieren. Die Partnerschaft zielt auf die Reaktion auf Machine-Speed-Bedrohungen ab — Cyberangriffe, die schneller ablaufen, als menschliche Analysten sie verfolgen können.

🟡 🛡️ Sicherheit 23. Juni 2026 · 2 Min. Lesezeit

NIST: Mathematischer Beweis unterstützt Übergang zur kontinuierlichen Überwachung der KI-Sicherheit

Editorial illustration: shield and continuous data flow graph representing AI security monitoring framework

NIST-Forscher haben einen mathematischen Beweis veröffentlicht, der den Ersatz einmaliger statischer KI-Sicherheitszertifizierungen durch ein Modell der kontinuierlichen Überwachung und Aktualisierung unterstützt — ein Paradigmenwechsel, der auf alle Produktions-KI-Systeme anwendbar ist, die regelmäßig aktualisiert werden.

🟡 🛡️ Sicherheit 21. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20225: Aktivierungsrichtungen erkennen Fehlausrichtung von LLMs mit 99,6 % Genauigkeit

Redaktionelle Illustration: Aktivierungsrichtungen enthüllen LLM-Fehlausrichtung mit 99,6 % Genauigkeit

Abdul Rafay Syed identifizierte eine gemeinsame Richtung im Aktivierungsraum von vier LLM-Familien — Qwen2.5, Gemma-2, Llama-3.2 und Ministral-3 — die ausgerichtete von fehlausgerichteten Modellen mit 99,6 % Genauigkeit trennt, während gerichtetes Steering den Abfluss von unsicherem Code um 21–51 Punkte reduziert.

🟡 🛡️ Sicherheit 21. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20553: NeuroImprint — versteckte Hintertür im föderalen Fine-Tuning rekonstruiert 59–79 % der Trainingsdaten

Redaktionelle Illustration: NeuroImprint — versteckte Hintertür im föderalen Fine-Tuning rekonstruiert 59–79 % der Trainingsdaten

NeuroImprint ist ein Angriff, der PEFT-Adapter im föderalen Fine-Tuning korrumpiert und 59–79 % aller Trainingsbeispiele mit hoher semantischer Treue rekonstruiert. Getestet auf BERT, GPT-2, Qwen2 und Llama 3.2, bleibt der Angriff unentdeckt, da das Modell seine normale Nützlichkeit behält.

🟡 🛡️ Sicherheit 20. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20508: Was Sprachmodelle aus gemischten Demonstrations sicheren und schädlichen Verhaltens lernen

Redaktionelle Illustration: Waage, die grüne und rote Verhaltensbeispiele ausbalanciert

Die Studie arXiv:2606.20508 untersucht, wie sicherheitsausgerichtete Sprachmodelle auf kontextuelle Beispiele reagieren, die harmlose und schädliche Demonstrationen mischen. Der Hauptbefund: Harmlose und schädliche Demonstrationen sind nicht austauschbar – harmlose Beispiele können je nach Modell schädliche Compliance sowohl senken als auch erhöhen, während Preference Optimization die Eskalation schädlichen Verhaltens verhindert.

🔴 🛡️ Sicherheit 19. Juni 2026 · 2 Min. Lesezeit

Google DeepMind: Über 50 % der KI-Agenten-Sicherheitsvorfälle sind Fehler, keine Angriffe

Redaktionelle Illustration: Über 50 % der Agenten-Sicherheitsvorfälle sind Fehler, keine Angriffe

Google DeepMind analysierte eine Million Agenten-Coding-Trajektorien und stellte fest, dass mehr als 50 % der gemeldeten Sicherheitsvorfälle bei KI-Agenten auf Aufgabenmissverständnisse oder übermäßigen Modelleifer zurückgehen, nicht auf externe Angriffe. Das verschiebt die Verteidigungsprioritäten.

Vollständiges Archiv ansehen →