arXiv:2607.15439:検証型コーディングエージェントがARC-AGI-3を完全攻略、RHAE約99%を達成
Sergey Rodionovは、実行可能なワールドモデル、簡略化、検証それぞれの寄与を明らかにするため、Codexベースのエージェントの4つの入れ子構造の変種をARC-AGI-3ベンチマークでテストしました。検証型変種はすべての設定で最良の結果を示し、gpt-5.6-solモデルと組み合わせることで、両方のreasoning effortレベルで公開されているすべてのゲームを完全に解き、約99%のRHAEを達成しました。
この記事はAIにより一次情報源から生成されました。
ARC-AGI-3とは何か、Sergey Rodionovはどのエージェント変種をテストしたのか?
ARC-AGI-3は、タスクをインタラクティブなゲームとして構成する汎用知能ベンチマークです——エージェントは静的なパズルを解く旧バージョンのARCとは異なり、環境のルールを発見し、その中で行動しなければなりません。Sergey Rodionovは、実行可能なワールドモデル——テキストベースの推測ではなく、コードの実行によって行動の結果を予測する内部シミュレータ——、タスクの簡略化、最終的な手を打つ前の結果の明示的な検証という3つの能力それぞれの寄与を切り分けるため、Codexベースのエージェント(OpenAIのCodexによるコード生成・実行アプローチを基盤とするエージェント)の4つの入れ子構造の変種をテストしました。
検証型変種がすべての設定で勝利
各手を打つ前に内部の環境モデルに照らして自らの解決策を検証する検証型変種は、テストされたすべての設定で最良であることが示されましたが——他の3つの変種よりも計算リソースの消費が著しく大きくなりました。このトレードオフは予想されたものです。追加の検証ステップは、より多くのモデル呼び出しとタスクごとの実行時間の延長を意味しますが、結果はそのコストを正当化するものでした。
検証型変種が公開ゲームセット全体を解決
gpt-5.6-solモデルを用いると、検証型変種はARC-AGI-3のテストされた両方のreasoning effortレベル(低・高の計算的「思考」の度合い)で、公開されているすべてのゲームを完全に解き、約99%のRHAE——試行総数に対する成功した行動の割合を測る指標——を達成しました。Rodionovはこれを「公開セットの飽和」、つまりベンチマークがほぼ完全に解決され、もはやより能力の高いエージェントを区別できなくなった状態と表現しています。
公開セットの飽和とベンチマークの将来
著者は、held-outパフォーマンス——隠された非公開のゲームセットでの結果——が、gpt-5.6-solのような新しいモデルではまだテストされていないため、公開結果からエージェントの能力の真の限界を確定することはできないと警告しています。ARC-AGI-3の公開部分の飽和は、将来のベンチマークが識別力を保つために、隠された評価に依存せざるを得なくなることを示唆しています。
よくある質問
- ARC-AGI-3とは何ですか?
- ARC-AGI-3は、タスクをインタラクティブなゲームとして提示する汎用知能ベンチマークであり、エージェントは環境のルールを発見し、その中で行動しなければなりません。
- 実行可能なワールドモデルとは何ですか?
- これは、モデルがテキストベースで結果を推測するのではなく、コードを実行することでエージェントの行動の結果を予測する内部シミュレータです。
- どのエージェント変種が最も成功しましたか、その理由は?
- 手を打つ前に解決策を検証する検証型変種は、gpt-5.6-solモデルと組み合わせることですべての設定で最良の結果を示し、約99%のRHAEを達成しましたが、リソース消費は大幅に高くなりました。
📬 AIニュースをあなたの受信箱へ
毎日のダイジェストを自分仕様に——トピック、ソース、頻度を選べます。ワンクリックで解除。