🟢 🤝 에이전트 게시일: · 1 분 읽기 ·

LangChain: IssueBench, 에이전트 트레이스 내 15개 오류 범주 인식을 내부적으로 측정

세 가지 도메인에 걸친 에이전트 트레이스 내 15개 오류 범주를 보여주는 IssueBench 벤치마크 다이어그램

LangChain은 LangSmith Engine이 에이전트 트레이스 내 문제를 얼마나 잘 인식하고 분류하는지 측정하는 내부 벤치마크인 IssueBench를 개발했습니다. 세 가지 도메인과 15개 오류 범주에 걸친 15개의 합성 과제로 구성되며, 숨겨진 ground-truth 라벨에 대해 격리된 테스트를 수행하는 Harbor 인프라에서 실행됩니다.

🤖

이 기사는 AI가 1차 출처를 기반으로 생성했습니다.

IssueBench란 무엇이며 LangChain은 왜 이를 사용하는가?

에이전트 트레이스는 AI 에이전트 실행 전체의 기록입니다—모든 도구 호출, 모든 결정, 모든 중간 단계가 시간순으로 기록됩니다. LangChain은 단순히 주관적인 인상만으로 도구의 신뢰성을 평가하는 대신, 자사의 LangSmith Engine이 이러한 트레이스 내 문제를 얼마나 잘 인식하고 분류하는지 측정하기 위한 내부 벤치마크인 IssueBench를 개발했습니다.

IssueBench의 구조: 도메인과 오류 범주

이 벤치마크는 SRE 로그 분석, 소프트웨어 엔지니어링, 고객 지원이라는 세 가지 도메인에 걸친 15개의 합성 과제로 구성됩니다. 또한 개인 데이터(PII) 유출과 환각(hallucination)부터 시스템 프롬프트 드리프트와 잘못된 도구 선택, 그리고 에이전트 루프와 가드레일 우회에 이르기까지 15개의 오류 범주를 다룹니다. 테스트는 Harbor 인프라에서 실행되며, 이는 숨겨진 ground-truth 라벨—모델의 결과와 비교되는, 미리 알려진 정답—에 대해 격리되고 재현 가능한 실행을 가능하게 합니다.

실제 프로덕션 트레이스 대신 합성 데이터 사용

저자인 Nick Bray와 Arjun Nargolwala는 통제된 ground-truth 라벨을 가진 합성 데이터가 실제 프로덕션 트레이스에 비해 갖는 장점을 강조합니다. 실제 기록에서는 어떤 것이 “정확한” 오류 범주인지 누구도 확실히 알 수 없는 반면, 합성 과제는 도구의 정밀도와 재현율을 정확하게 측정할 수 있게 해줍니다. 이 접근 방식을 통해 LangChain은 비교 가능하고 재현 가능한 방식으로 LangSmith Engine의 발전을 시간에 따라 추적할 수 있습니다.

자주 묻는 질문

에이전트 트레이스란 무엇인가요?
에이전트 트레이스는 모든 도구 호출, 결정, 중간 단계를 포함하는 AI 에이전트 실행의 시간순 기록으로, 행동과 오류를 분석하는 데 사용됩니다.
LangChain은 왜 실제 트레이스 대신 합성 데이터를 사용하나요?
합성 과제는 통제되고 미리 알려진 ground-truth 라벨을 가지고 있어 LangSmith Engine의 정확도를 정밀하게 측정할 수 있게 해줍니다. 반면 실제 프로덕션 트레이스에서는 정확한 오류 범주가 항상 알려져 있지는 않습니다.

📬 AI 뉴스를 받은편지함으로

나만의 방식으로 구성하는 일일 다이제스트 — 주제, 출처, 주기를 선택하세요. 원클릭 해지.