arXiv:2607.15439:验证型编程智能体完全攻克ARC-AGI-3,RHAE约达99%
Sergey Rodionov测试了四种基于Codex的嵌套式智能体变体,在ARC-AGI-3基准上评估可执行世界模型、简化和验证各自的贡献。验证型变体在所有设置中表现最佳,配合gpt-5.6-sol模型,在两种推理强度水平下完全解决了每一个公开游戏,达到约99%的RHAE。
本文由人工智能基于一手来源生成。
什么是ARC-AGI-3,Sergey Rodionov测试了哪些智能体变体?
ARC-AGI-3是一个通用智能基准,将任务设计为交互式游戏——智能体必须发现环境规则并在其中采取行动,而不是像早期版本的ARC那样解答静态谜题。Sergey Rodionov测试了四种基于Codex的嵌套式智能体变体(即建立在OpenAI Codex代码生成与执行方法之上的智能体),旨在分离出三种能力各自的贡献:可执行世界模型——一种通过执行代码来预测行动后果、而非文字猜测的内部模拟器——任务简化,以及在最终落子前对结果进行显式验证。
验证型变体在所有设置中胜出
验证型变体在每次落子前都会对照内部环境模型验证自己的方案,在所有测试设置中都表现最佳——但其计算资源消耗明显高于其余三种变体。这一权衡在意料之中:额外的验证步骤意味着更多的模型调用与更长的单任务执行时间,但结果证明了这一成本的合理性。
验证型变体解决了整个公开游戏集
配合gpt-5.6-sol模型,验证型变体在两种测试的推理强度水平(较低与较高的计算”思考”程度)下,完全解决了ARC-AGI-3中的每一个公开游戏,达到约99%的RHAE——一种衡量成功行动占尝试总数比例的指标。Rodionov将此描述为”公开集的饱和”,即基准已几乎被完全攻克,不再能区分智能体能力高低的状态。
公开集的饱和与基准的未来
作者提醒,held-out表现——即在隐藏的、非公开游戏集上的结果——目前尚未用更新的模型如gpt-5.6-sol进行测试,因此无法从公开结果中确定智能体能力的真实边界。ARC-AGI-3公开部分的饱和意味着,未来的基准测试将不得不依赖隐藏评估,才能保持其区分能力的价值。
常见问题
- 什么是ARC-AGI-3?
- ARC-AGI-3是一个通用智能基准,将任务呈现为交互式游戏,智能体必须发现环境规则并在其中采取行动。
- 什么是可执行世界模型?
- 这是一种内部模拟器,通过执行代码来预测智能体行动的后果,而不是让模型依赖文字性猜测结果。
- 哪种智能体变体表现最佳,为什么?
- 验证型变体在落子前先验证方案,配合gpt-5.6-sol模型,在所有设置中表现最佳,达到约99%的RHAE,但资源消耗明显更高。
📬 AI 新闻直达您的邮箱
按您的方式定制每日摘要——自选主题、来源和频率,一键退订。