🟢 🤝 智能体 发布于: · 1 分钟阅读 ·

arXiv:2607.18754: 开源LLM智能体诊断工具AgentDebugX将GAIA基准测试准确率提升至63.6%

arXiv:2607.18754 ↗

AgentDebugX的Detect-Attribute-Recover-Rerun循环图示,用于诊断LLM智能体错误

Kunlun Zhu、Xuyan Ye及12位合作者提出了AgentDebugX,一个用于检测、归因和恢复LLM智能体错误的开源框架。在Who and When基准测试中,其归因准确率达到28.8%,高于最强基线的21.7%;在GAIA基准测试中,它修复了73个失败任务中的13个,将准确率从55.8%提升至63.6%。

🤖

本文由人工智能基于一手来源生成。

AgentDebugX是什么,Detect-Attribute-Recover-Rerun循环又是什么?

Kunlun Zhu、Xuyan Ye及另外10位合作者,共12位作者,在论文《AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents》(arXiv:2607.18754)中提出了AgentDebugX。这是一个开源调试框架,用于检测、诊断和恢复LLM智能体的错误,围绕Detect-Attribute-Recover-Rerun循环构建:检测错误、归因原因、恢复系统、重新运行。该工具提供Python库、CLI工具、网页控制台和agentic skill等形式,并配有可选加入(opt-in)的Error Hub,供用户自愿共享错误数据。

根因归因的准确率有多高?

DeepDebug模块进行multi-turn根因诊断,即通过多轮分析来确定究竟是哪个智能体、哪一步骤导致了失败。在「Who and When」基准测试中,AgentDebugX在Qwen 3.5-9B模型上实现了28.8%的智能体与步骤归因准确率,高于最强基线(参照对比)的21.7%。

GAIA基准测试准确率从55.8%提升至63.6%

在面向通用AI智能体的任务集GAIA基准测试中,AgentDebugX仅通过一次重跑就修复了此前73个失败任务中的13个,而解耦基线仅能修复4到6个,使总体准确率从55.8%提升至63.6%。

常见问题

AgentDebugX是什么?
AgentDebugX是一个开源调试框架(debugging framework),用于检测、归因和恢复LLM智能体的错误,围绕Detect-Attribute-Recover-Rerun(检测-归因-恢复-重跑)循环构建,提供Python库、CLI、网页控制台和agentic skill等多种形式。
什么是根因归因(root-cause attribution)和DeepDebug模块?
根因归因(root-cause attribution)是找出导致多智能体系统失败的具体智能体和步骤的过程。DeepDebug模块通过多轮对话进行multi-turn诊断,以更精确地定位错误的根本原因。
AgentDebugX在GAIA基准测试上带来了多大提升?
GAIA基准测试是一组用于测试通用AI智能体能力的任务集合。AgentDebugX在一次重跑中修复了此前73个失败任务中的13个,而解耦(decoupled)基线仅能修复4到6个,并将总体准确率从55.8%提升至63.6%。

📬 AI 新闻直达您的邮箱

按您的方式定制每日摘要——自选主题、来源和频率,一键退订。