🟡 🤝 智能体 发布于: · 2 分钟阅读 ·

arXiv:2607.15439:验证型编程智能体完全攻克ARC-AGI-3,RHAE约达99%

arXiv:2607.15439 ↗

四种编程智能体变体在ARC-AGI-3基准上的对比,验证型变体达到约99% RHAE

Sergey Rodionov测试了四种基于Codex的嵌套式智能体变体,在ARC-AGI-3基准上评估可执行世界模型、简化和验证各自的贡献。验证型变体在所有设置中表现最佳,配合gpt-5.6-sol模型,在两种推理强度水平下完全解决了每一个公开游戏,达到约99%的RHAE。

🤖

本文由人工智能基于一手来源生成。

什么是ARC-AGI-3,Sergey Rodionov测试了哪些智能体变体?

ARC-AGI-3是一个通用智能基准,将任务设计为交互式游戏——智能体必须发现环境规则并在其中采取行动,而不是像早期版本的ARC那样解答静态谜题。Sergey Rodionov测试了四种基于Codex的嵌套式智能体变体(即建立在OpenAI Codex代码生成与执行方法之上的智能体),旨在分离出三种能力各自的贡献:可执行世界模型——一种通过执行代码来预测行动后果、而非文字猜测的内部模拟器——任务简化,以及在最终落子前对结果进行显式验证。

验证型变体在所有设置中胜出

验证型变体在每次落子前都会对照内部环境模型验证自己的方案,在所有测试设置中都表现最佳——但其计算资源消耗明显高于其余三种变体。这一权衡在意料之中:额外的验证步骤意味着更多的模型调用与更长的单任务执行时间,但结果证明了这一成本的合理性。

验证型变体解决了整个公开游戏集

配合gpt-5.6-sol模型,验证型变体在两种测试的推理强度水平(较低与较高的计算”思考”程度)下,完全解决了ARC-AGI-3中的每一个公开游戏,达到约99%的RHAE——一种衡量成功行动占尝试总数比例的指标。Rodionov将此描述为”公开集的饱和”,即基准已几乎被完全攻克,不再能区分智能体能力高低的状态。

公开集的饱和与基准的未来

作者提醒,held-out表现——即在隐藏的、非公开游戏集上的结果——目前尚未用更新的模型如gpt-5.6-sol进行测试,因此无法从公开结果中确定智能体能力的真实边界。ARC-AGI-3公开部分的饱和意味着,未来的基准测试将不得不依赖隐藏评估,才能保持其区分能力的价值。

常见问题

什么是ARC-AGI-3?
ARC-AGI-3是一个通用智能基准,将任务呈现为交互式游戏,智能体必须发现环境规则并在其中采取行动。
什么是可执行世界模型?
这是一种内部模拟器,通过执行代码来预测智能体行动的后果,而不是让模型依赖文字性猜测结果。
哪种智能体变体表现最佳,为什么?
验证型变体在落子前先验证方案,配合gpt-5.6-sol模型,在所有设置中表现最佳,达到约99%的RHAE,但资源消耗明显更高。

📬 AI 新闻直达您的邮箱

按您的方式定制每日摘要——自选主题、来源和频率,一键退订。