arXiv:2607.15439: Verifikacijski coding agenti potpuno rješavaju ARC-AGI-3 uz oko 99% RHAE rezultata
Sergey Rodionov testira četiri ugniježđene varijante Codex-based agenata na benchmarku ARC-AGI-3 kako bi utvrdio doprinos executable world modela, pojednostavljenja i verifikacije. Verifikacijska varijanta je najbolja u svim postavkama, a uz model gpt-5.6-sol potpuno rješava svaku javnu igru na oba nivoa reasoning effort-a, postižući oko 99% RHAE.
Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.
Što je ARC-AGI-3 i koje varijante agenata Sergey Rodionov testira?
ARC-AGI-3 je benchmark opće inteligencije koji zadatke oblikuje kao interaktivne igre — agent mora otkriti pravila okruženja i djelovati unutar njega, umjesto da rješava statične zagonetke poput ranijih verzija ARC-a. Sergey Rodionov testira četiri ugniježđene varijante Codex-based agenata (agenata izgrađenih na temeljima OpenAI-jevog Codex pristupa generiranju i izvršavanju koda) kako bi izolirao doprinos triju sposobnosti: executable world modela — internog simulatora koji predviđa posljedice akcija izvršavanjem koda, umjesto tekstualnog nagađanja — pojednostavljenja zadatka i eksplicitne verifikacije rezultata prije konačnog poteza.
Verifikacijska varijanta pobjeđuje u svim postavkama
Verifikacijska varijanta, koja prije svakog poteza provjerava vlastito rješenje nasuprot internom modelu okruženja, pokazuje se najboljom u svim testiranim postavkama — no uz znatno veću potrošnju računalnih resursa od ostalih triju varijanti. Taj kompromis je očekivan: dodatni korak provjere znači dodatne pozive modelu i dulje vrijeme izvršavanja po zadatku, ali rezultat opravdava trošak.
Verifikacijska varijanta rješava cijeli javni set igara
S modelom gpt-5.6-sol, verifikacijska varijanta potpuno rješava svaku javnu igru u ARC-AGI-3 na oba testirana nivoa reasoning effort-a (nižem i višem stupnju računalnog “razmišljanja” prije poteza), postižući približno 99% RHAE — metrike koja mjeri udio uspješno riješenih akcija u odnosu na ukupan broj pokušaja. Rodionov to opisuje kao “saturaciju javnog seta”, odnosno stanje u kojem benchmark više ne razlikuje sposobnije agente jer je gotovo u potpunosti riješen.
Saturacija javnog seta i budućnost benchmarka
Autor upozorava da held-out izvedba — rezultati na skrivenom, nejavnom setu igara — ostaje netestirana s novijim modelom poput gpt-5.6-sol, pa se stvarna granica sposobnosti agenata ne može utvrditi iz javnih rezultata. Saturacija javnog dijela ARC-AGI-3 signalizira da će budući benchmarci morati oslanjati se na skrivene evaluacije kako bi zadržali diskriminativnu vrijednost.
Česta pitanja
- Što je ARC-AGI-3?
- ARC-AGI-3 je benchmark opće inteligencije koji zadatke prikazuje kao interaktivne igre, gdje agent mora otkriti pravila okruženja i djelovati unutar njega.
- Što je executable world model?
- To je interni simulator koji izvršavanjem koda predviđa posljedice agentovih akcija prije stvarnog poteza, umjesto da se model oslanja na tekstualno nagađanje ishoda.
- Koja je varijanta agenta bila najuspješnija i zašto?
- Verifikacijska varijanta, koja provjerava rješenje prije poteza, bila je najbolja u svim postavkama uz model gpt-5.6-sol, postižući oko 99% RHAE uz znatno veću potrošnju resursa.
📬 AI vijesti u tvoj inbox
Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.
Povezane vijesti
arXiv:2607.15901: DSWorld world model ubrzava agente za data science čak 14 puta u treningu i inferenciji
LangChain: IssueBench interno mjeri prepoznavanje 15 kategorija grešaka unutar agent trace-ovima sustava
arXiv:2607.15193: Plover vodi GUI agente kroz plan-centrični, editabilni pristup interakciji s korisnikom