🟢 🤝 Agenti Objavljeno: · 1 min čitanja ·

arXiv:2607.18754: AgentDebugX otvoreni alat za dijagnozu LLM agenata podiže točnost GAIA benchmarka na 63,6%

arXiv:2607.18754 ↗

Dijagram AgentDebugX petlje Detect-Attribute-Recover-Rerun za dijagnozu grešaka LLM agenata

Kunlun Zhu, Xuyan Ye i 12 suradnika predstavljaju AgentDebugX, open-source okvir za otkrivanje, pripisivanje i oporavak grešaka LLM agenata. Na benchmarku Who and When postiže 28,8% točnosti pripisivanja naspram 21,7% najjačeg baselinea, a na GAIA benchmarku popravlja 13 od 73 propalih zadataka i podiže točnost s 55,8% na 63,6%.

🤖

Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.

Što je AgentDebugX i petlja Detect-Attribute-Recover-Rerun?

Kunlun Zhu, Xuyan Ye i još 10 suradnika, ukupno 12 autora, predstavljaju AgentDebugX u radu “AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents” (arXiv:2607.18754). Riječ je o open-source debugging frameworku, alatu za otkrivanje, dijagnosticiranje i oporavak od grešaka LLM agenata, izgrađenom oko petlje Detect-Attribute-Recover-Rerun: otkrij grešku, pripiši uzrok, oporavi sustav, pokreni ponovno. Dostupan je kao Python biblioteka, CLI alat, web konzola i agentic skill, uz opt-in Error Hub za dobrovoljno dijeljenje podataka o greškama među korisnicima.

Kolika je točnost root-cause atribucije?

Modul DeepDebug provodi multi-turn root-cause dijagnozu, višekružnu analizu koja pokušava utvrditi točno koji je agent i koji korak u nizu uzrokovao neuspjeh. Na benchmarku “Who and When” AgentDebugX postiže 28,8% točnosti u pripisivanju agenta i koraka na modelu Qwen 3.5-9B, naspram 21,7% kod najjačeg baselinea, referentne usporedbe.

Poboljšanje na GAIA benchmarku s 55,8% na 63,6%

Na GAIA benchmarku, skupu zadataka za opće AI agente, AgentDebugX popravlja 13 od 73 prethodno propalih zadataka u samo jednom rerunu, naspram 4 do 6 kod decoupled baselinea, čime ukupna točnost raste s 55,8% na 63,6%.

Česta pitanja

Što je AgentDebugX?
AgentDebugX je open-source debugging framework, okvir za otkrivanje, pripisivanje i oporavak grešaka LLM agenata, izgrađen oko petlje Detect-Attribute-Recover-Rerun, otkrij-pripiši-oporavi-ponovno pokreni, dostupan kao Python biblioteka, CLI, web konzola i agentic skill.
Što je root-cause atribucija i modul DeepDebug?
Root-cause atribucija je postupak pronalaženja agenta i koraka koji je uzrokovao neuspjeh višeagentskog sustava. Modul DeepDebug provodi multi-turn dijagnozu kroz više krugova razgovora kako bi preciznije locirao izvorni uzrok pogreške.
Koliko AgentDebugX poboljšava rezultate na GAIA benchmarku?
GAIA benchmark je skup zadataka za testiranje sposobnosti općih AI agenata. AgentDebugX na njemu popravlja 13 od 73 prethodno propalih zadataka u jednom rerunu, naspram 4 do 6 kod decoupled baselinea, i podiže ukupnu točnost s 55,8% na 63,6%.

📬 AI vijesti u tvoj inbox

Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.