🟢 🤝 エージェント 公開日: · 2 分で読めます ·

LangChain:IssueBenchが内部でエージェントトレース内の15カテゴリのエラー認識を測定

3つのドメインにわたるエージェントトレース内の15のエラーカテゴリを示すIssueBenchベンチマークの図

LangChainはIssueBenchを開発しました。これは、LangSmith Engineがエージェントトレース内の問題をどれだけうまく認識・分類できるかを測定する内部ベンチマークです。3つのドメインと15のエラーカテゴリにわたる15の合成タスクで構成され、隠されたground-truthラベルに対して分離テストを行うHarborインフラ上で実行されます。

🤖

この記事はAIにより一次情報源から生成されました。

IssueBenchとは何か、なぜLangChainはそれを使うのか?

エージェントトレースとは、AIエージェントの実行全体の記録です——すべてのツール呼び出し、すべての判断、すべての中間ステップが時系列順に記録されます。LangChainは、単に主観的な印象だけでツールの信頼性を評価するのではなく、自社のLangSmith Engineがこうしたトレース内の問題をどれだけうまく認識・分類できるかを測定するための内部ベンチマーク、IssueBenchを開発しました。

IssueBenchの構造:ドメインとエラーカテゴリ

このベンチマークは、SREログ分析、ソフトウェアエンジニアリング、カスタマーサポートという3つのドメインにわたる15の合成タスクで構成されています。さらに、個人データ(PII)漏洩やハルシネーションから、システムプロンプトのドリフトやツール選択の誤り、そしてエージェントのループやガードレールの回避まで、15のエラーカテゴリをカバーしています。テストはHarborインフラ上で実行され、これは隠されたground-truthラベル——モデルの結果と比較される、あらかじめ既知の正しい答え——に対して分離された、再現可能な実行を可能にします。

実際のプロダクショントレースの代わりに合成データを使う

著者のNick BrayとArjun Nargolwalaは、制御されたground-truthラベルを持つ合成データが実際のプロダクショントレースに対して持つ優位性を強調しています。実際の記録では、どれが「正しい」エラーカテゴリなのか誰も確実には分からない一方、合成タスクはツールの適合率と再現率を正確に測定することを可能にします。このアプローチにより、LangChainは比較可能かつ再現可能な方法で、LangSmith Engineの進捗を時間とともに追跡できるようになります。

よくある質問

エージェントトレースとは何ですか?
エージェントトレースとは、ツール呼び出し、判断、中間ステップのすべてを含む、AIエージェントの実行の時系列記録であり、動作やエラーの分析に使用されます。
LangChainはなぜ実際のトレースの代わりに合成データを使うのですか?
合成タスクには制御された、あらかじめ既知のground-truthラベルがあり、これによりLangSmith Engineの精度を正確に測定できます。一方、実際のプロダクショントレースでは正しいエラーカテゴリが必ずしも判明しているとは限りません。

📬 AIニュースをあなたの受信箱へ

毎日のダイジェストを自分仕様に——トピック、ソース、頻度を選べます。ワンクリックで解除。