arXiv:2607.18754: AgentDebugX, Open-Source-Diagnosetool für LLM-Agenten, hebt die GAIA-Benchmark-Genauigkeit auf 63,6 %
Kunlun Zhu, Xuyan Ye und 12 Mitautoren stellen AgentDebugX vor, ein Open-Source-Framework zur Erkennung, Zuordnung und Behebung von Fehlern bei LLM-Agenten. Auf dem Who-and-When-Benchmark erreicht es eine Zuordnungsgenauigkeit von 28,8 % gegenüber 21,7 % beim stärksten Baseline, und auf dem GAIA-Benchmark behebt es 13 von 73 gescheiterten Aufgaben und hebt die Genauigkeit von 55,8 % auf 63,6 %.
Dieser Artikel wurde mithilfe von künstlicher Intelligenz aus Primärquellen erstellt.
Was ist AgentDebugX, und was ist die Detect-Attribute-Recover-Rerun-Schleife?
Kunlun Zhu, Xuyan Ye und 10 weitere Mitautoren, insgesamt 12 Autoren, stellen AgentDebugX im Paper „AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents” (arXiv:2607.18754) vor. Es handelt sich um ein Open-Source-Debugging-Framework, ein Tool zur Erkennung, Diagnose und Behebung von Fehlern bei LLM-Agenten, aufgebaut um die Detect-Attribute-Recover-Rerun-Schleife: Fehler erkennen, Ursache zuordnen, System wiederherstellen, erneut ausführen. Es ist als Python-Bibliothek, CLI-Tool, Web-Konsole und Agentic Skill verfügbar, mit einem Opt-in-Error-Hub zum freiwilligen Teilen von Fehlerdaten zwischen Nutzern.
Wie genau ist die Root-Cause-Attribution?
Das Modul DeepDebug führt eine Multi-Turn-Root-Cause-Diagnose durch, eine mehrrundige Analyse, die genau ermitteln soll, welcher Agent und welcher Schritt in der Abfolge das Scheitern verursacht hat. Auf dem Benchmark „Who and When” erreicht AgentDebugX beim Modell Qwen 3.5-9B eine Genauigkeit von 28,8 % bei der Zuordnung von Agent und Schritt, gegenüber 21,7 % beim stärksten Baseline, einem Referenzvergleich.
Verbesserung auf dem GAIA-Benchmark von 55,8 % auf 63,6 %
Auf dem GAIA-Benchmark, einer Sammlung von Aufgaben für allgemeine KI-Agenten, behebt AgentDebugX 13 von 73 zuvor gescheiterten Aufgaben in nur einem Rerun, gegenüber 4 bis 6 beim Decoupled-Baseline, und hebt damit die Gesamtgenauigkeit von 55,8 % auf 63,6 %.
Häufig gestellte Fragen
- Was ist AgentDebugX?
- AgentDebugX ist ein Open-Source-Debugging-Framework, ein Toolkit zur Erkennung, Zuordnung und Behebung von Fehlern bei LLM-Agenten, aufgebaut um die Detect-Attribute-Recover-Rerun-Schleife (Erkennen-Zuordnen-Beheben-Neustarten), verfügbar als Python-Bibliothek, CLI, Web-Konsole und Agentic Skill.
- Was ist Root-Cause-Attribution, und was ist das Modul DeepDebug?
- Root-Cause-Attribution ist der Prozess, den Agenten und Schritt zu identifizieren, der das Scheitern eines Multi-Agenten-Systems verursacht hat. Das Modul DeepDebug führt eine Multi-Turn-Diagnose über mehrere Gesprächsrunden durch, um die eigentliche Fehlerursache präziser zu lokalisieren.
- Wie stark verbessert AgentDebugX die Ergebnisse auf dem GAIA-Benchmark?
- Der GAIA-Benchmark ist eine Sammlung von Aufgaben zur Prüfung der Fähigkeiten allgemeiner KI-Agenten. AgentDebugX behebt darauf 13 von 73 zuvor gescheiterten Aufgaben in einem einzigen Rerun, gegenüber 4 bis 6 beim Decoupled-Baseline, und hebt die Gesamtgenauigkeit von 55,8 % auf 63,6 %.
📬 KI-News in dein Postfach
Ein täglicher Digest nach deinen Regeln — Themen, Quellen und Rhythmus wählbar. Abmeldung mit einem Klick.
Verwandte Nachrichten
Anthropic Release Notes: Fünf Neuerungen für Claude Managed Agents — Effort-Stufe, Webhooks und Session-Seeding
Cursor: Router leitet Anfragen intelligent an das passendste Modell weiter und wird zur Standardoption für den Teams-Plan
monday.com: internes Agentensystem Sphera betreibt produktive KI-Agenten auf Amazon Bedrock mit 7 AWS-Diensten