🟡 🤝 에이전트 게시일: · 2 분 읽기 ·

arXiv:2607.15439: 검증형 코딩 에이전트, ARC-AGI-3 완전 정복—RHAE 약 99% 달성

arXiv:2607.15439 ↗

ARC-AGI-3 벤치마크에서 네 가지 코딩 에이전트 변형을 비교, 검증형 변형이 약 99% RHAE 달성

Sergey Rodionov는 실행 가능한 세계 모델, 단순화, 검증 각각의 기여도를 규명하기 위해 Codex 기반 에이전트의 네 가지 중첩 변형을 ARC-AGI-3 벤치마크에서 테스트했습니다. 검증형 변형은 모든 설정에서 최고의 성능을 보였으며, gpt-5.6-sol 모델과 결합했을 때 두 가지 reasoning effort 수준 모두에서 공개된 모든 게임을 완전히 해결해 약 99%의 RHAE를 달성했습니다.

🤖

이 기사는 AI가 1차 출처를 기반으로 생성했습니다.

ARC-AGI-3란 무엇이며 Sergey Rodionov는 어떤 에이전트 변형을 테스트했는가?

ARC-AGI-3은 과제를 인터랙티브 게임으로 구성하는 일반 지능 벤치마크입니다—에이전트는 이전 버전의 ARC처럼 정적인 퍼즐을 푸는 대신, 환경의 규칙을 발견하고 그 안에서 행동해야 합니다. Sergey Rodionov는 실행 가능한 세계 모델—텍스트 기반 추측 대신 코드 실행을 통해 행동의 결과를 예측하는 내부 시뮬레이터—, 과제 단순화, 최종 수를 두기 전 결과에 대한 명시적 검증이라는 세 가지 능력 각각의 기여를 분리하기 위해 Codex 기반 에이전트(OpenAI의 Codex 코드 생성·실행 접근 방식을 기반으로 하는 에이전트)의 네 가지 중첩 변형을 테스트했습니다.

검증형 변형이 모든 설정에서 승리

매 수를 두기 전에 내부 환경 모델에 비추어 자신의 해법을 검증하는 검증형 변형은 테스트된 모든 설정에서 최고의 성능을 보였습니다—다만 다른 세 변형보다 연산 자원 소모가 훨씬 컸습니다. 이 트레이드오프는 예상된 것입니다. 추가 검증 단계는 더 많은 모델 호출과 과제별 실행 시간 증가를 의미하지만, 결과는 그 비용을 정당화했습니다.

검증형 변형이 공개 게임 세트 전체를 해결

gpt-5.6-sol 모델을 사용했을 때, 검증형 변형은 ARC-AGI-3에서 테스트된 두 가지 reasoning effort 수준(낮음과 높음의 연산적 “사고” 정도) 모두에서 공개된 모든 게임을 완전히 해결하며, 약 99%의 RHAE—시도 총수 대비 성공한 행동의 비율을 측정하는 지표—를 달성했습니다. Rodionov는 이를 “공개 세트의 포화”라고 표현하는데, 이는 벤치마크가 거의 완전히 해결되어 더 이상 능력이 뛰어난 에이전트를 구별할 수 없는 상태를 의미합니다.

공개 세트의 포화와 벤치마크의 미래

저자는 held-out 성능—숨겨진 비공개 게임 세트에서의 결과—이 gpt-5.6-sol 같은 최신 모델로는 아직 테스트되지 않았기 때문에, 공개 결과만으로는 에이전트 능력의 실제 한계를 확정할 수 없다고 경고합니다. ARC-AGI-3 공개 부분의 포화는 향후 벤치마크가 변별력을 유지하려면 숨겨진 평가에 의존해야 할 것임을 시사합니다.

자주 묻는 질문

ARC-AGI-3란 무엇인가요?
ARC-AGI-3은 과제를 인터랙티브 게임으로 제시하는 일반 지능 벤치마크로, 에이전트는 환경의 규칙을 스스로 발견하고 그 안에서 행동해야 합니다.
실행 가능한 세계 모델이란 무엇인가요?
이는 모델이 텍스트로 결과를 추측하는 대신, 코드를 실행하여 에이전트 행동의 결과를 예측하는 내부 시뮬레이터입니다.
어떤 에이전트 변형이 가장 성공적이었으며 그 이유는 무엇인가요?
수를 두기 전 해법을 검증하는 검증형 변형은 gpt-5.6-sol 모델과 결합해 모든 설정에서 최고의 성능을 보였으며, 약 99%의 RHAE를 달성했지만 자원 소모가 훨씬 컸습니다.

📬 AI 뉴스를 받은편지함으로

나만의 방식으로 구성하는 일일 다이제스트 — 주제, 출처, 주기를 선택하세요. 원클릭 해지.