🟡 🤝 Agenti Objavljeno: · 2 min čitanja ·

arXiv:2607.15439: Verifikacijski coding agenti potpuno rješavaju ARC-AGI-3 uz oko 99% RHAE rezultata

arXiv:2607.15439 ↗

Usporedba četiri varijante coding agenata na ARC-AGI-3 benchmarku, verifikacijska varijanta postiže oko 99% RHAE

Sergey Rodionov testira četiri ugniježđene varijante Codex-based agenata na benchmarku ARC-AGI-3 kako bi utvrdio doprinos executable world modela, pojednostavljenja i verifikacije. Verifikacijska varijanta je najbolja u svim postavkama, a uz model gpt-5.6-sol potpuno rješava svaku javnu igru na oba nivoa reasoning effort-a, postižući oko 99% RHAE.

🤖

Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.

Što je ARC-AGI-3 i koje varijante agenata Sergey Rodionov testira?

ARC-AGI-3 je benchmark opće inteligencije koji zadatke oblikuje kao interaktivne igre — agent mora otkriti pravila okruženja i djelovati unutar njega, umjesto da rješava statične zagonetke poput ranijih verzija ARC-a. Sergey Rodionov testira četiri ugniježđene varijante Codex-based agenata (agenata izgrađenih na temeljima OpenAI-jevog Codex pristupa generiranju i izvršavanju koda) kako bi izolirao doprinos triju sposobnosti: executable world modela — internog simulatora koji predviđa posljedice akcija izvršavanjem koda, umjesto tekstualnog nagađanja — pojednostavljenja zadatka i eksplicitne verifikacije rezultata prije konačnog poteza.

Verifikacijska varijanta pobjeđuje u svim postavkama

Verifikacijska varijanta, koja prije svakog poteza provjerava vlastito rješenje nasuprot internom modelu okruženja, pokazuje se najboljom u svim testiranim postavkama — no uz znatno veću potrošnju računalnih resursa od ostalih triju varijanti. Taj kompromis je očekivan: dodatni korak provjere znači dodatne pozive modelu i dulje vrijeme izvršavanja po zadatku, ali rezultat opravdava trošak.

Verifikacijska varijanta rješava cijeli javni set igara

S modelom gpt-5.6-sol, verifikacijska varijanta potpuno rješava svaku javnu igru u ARC-AGI-3 na oba testirana nivoa reasoning effort-a (nižem i višem stupnju računalnog “razmišljanja” prije poteza), postižući približno 99% RHAE — metrike koja mjeri udio uspješno riješenih akcija u odnosu na ukupan broj pokušaja. Rodionov to opisuje kao “saturaciju javnog seta”, odnosno stanje u kojem benchmark više ne razlikuje sposobnije agente jer je gotovo u potpunosti riješen.

Saturacija javnog seta i budućnost benchmarka

Autor upozorava da held-out izvedba — rezultati na skrivenom, nejavnom setu igara — ostaje netestirana s novijim modelom poput gpt-5.6-sol, pa se stvarna granica sposobnosti agenata ne može utvrditi iz javnih rezultata. Saturacija javnog dijela ARC-AGI-3 signalizira da će budući benchmarci morati oslanjati se na skrivene evaluacije kako bi zadržali diskriminativnu vrijednost.

Česta pitanja

Što je ARC-AGI-3?
ARC-AGI-3 je benchmark opće inteligencije koji zadatke prikazuje kao interaktivne igre, gdje agent mora otkriti pravila okruženja i djelovati unutar njega.
Što je executable world model?
To je interni simulator koji izvršavanjem koda predviđa posljedice agentovih akcija prije stvarnog poteza, umjesto da se model oslanja na tekstualno nagađanje ishoda.
Koja je varijanta agenta bila najuspješnija i zašto?
Verifikacijska varijanta, koja provjerava rješenje prije poteza, bila je najbolja u svim postavkama uz model gpt-5.6-sol, postižući oko 99% RHAE uz znatno veću potrošnju resursa.

📬 AI vijesti u tvoj inbox

Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.