arXiv:2607.18754: AgentDebugX otvoreni alat za dijagnozu LLM agenata podiže točnost GAIA benchmarka na 63,6%
Kunlun Zhu, Xuyan Ye i 12 suradnika predstavljaju AgentDebugX, open-source okvir za otkrivanje, pripisivanje i oporavak grešaka LLM agenata. Na benchmarku Who and When postiže 28,8% točnosti pripisivanja naspram 21,7% najjačeg baselinea, a na GAIA benchmarku popravlja 13 od 73 propalih zadataka i podiže točnost s 55,8% na 63,6%.
Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.
Što je AgentDebugX i petlja Detect-Attribute-Recover-Rerun?
Kunlun Zhu, Xuyan Ye i još 10 suradnika, ukupno 12 autora, predstavljaju AgentDebugX u radu “AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents” (arXiv:2607.18754). Riječ je o open-source debugging frameworku, alatu za otkrivanje, dijagnosticiranje i oporavak od grešaka LLM agenata, izgrađenom oko petlje Detect-Attribute-Recover-Rerun: otkrij grešku, pripiši uzrok, oporavi sustav, pokreni ponovno. Dostupan je kao Python biblioteka, CLI alat, web konzola i agentic skill, uz opt-in Error Hub za dobrovoljno dijeljenje podataka o greškama među korisnicima.
Kolika je točnost root-cause atribucije?
Modul DeepDebug provodi multi-turn root-cause dijagnozu, višekružnu analizu koja pokušava utvrditi točno koji je agent i koji korak u nizu uzrokovao neuspjeh. Na benchmarku “Who and When” AgentDebugX postiže 28,8% točnosti u pripisivanju agenta i koraka na modelu Qwen 3.5-9B, naspram 21,7% kod najjačeg baselinea, referentne usporedbe.
Poboljšanje na GAIA benchmarku s 55,8% na 63,6%
Na GAIA benchmarku, skupu zadataka za opće AI agente, AgentDebugX popravlja 13 od 73 prethodno propalih zadataka u samo jednom rerunu, naspram 4 do 6 kod decoupled baselinea, čime ukupna točnost raste s 55,8% na 63,6%.
Česta pitanja
- Što je AgentDebugX?
- AgentDebugX je open-source debugging framework, okvir za otkrivanje, pripisivanje i oporavak grešaka LLM agenata, izgrađen oko petlje Detect-Attribute-Recover-Rerun, otkrij-pripiši-oporavi-ponovno pokreni, dostupan kao Python biblioteka, CLI, web konzola i agentic skill.
- Što je root-cause atribucija i modul DeepDebug?
- Root-cause atribucija je postupak pronalaženja agenta i koraka koji je uzrokovao neuspjeh višeagentskog sustava. Modul DeepDebug provodi multi-turn dijagnozu kroz više krugova razgovora kako bi preciznije locirao izvorni uzrok pogreške.
- Koliko AgentDebugX poboljšava rezultate na GAIA benchmarku?
- GAIA benchmark je skup zadataka za testiranje sposobnosti općih AI agenata. AgentDebugX na njemu popravlja 13 od 73 prethodno propalih zadataka u jednom rerunu, naspram 4 do 6 kod decoupled baselinea, i podiže ukupnu točnost s 55,8% na 63,6%.
📬 AI vijesti u tvoj inbox
Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.
Povezane vijesti
Anthropic Release Notes: pet novosti za Claude Managed Agents — effort razina, webhookovi i seeding sesija
Cursor: Router pametno usmjerava upite prema najprikladnijem modelu te postaje zadana opcija za Teams plan
monday.com: interni agentski sustav Sphera pokreće produkcijske AI agente na Amazon Bedrock uz 7 AWS servisa