🟡 🤝 Agenten Veröffentlicht: · 2 Min. Lesezeit ·

arXiv:2607.15439: Verifikations-Coding-Agenten lösen ARC-AGI-3 vollständig mit rund 99 % RHAE

arXiv:2607.15439 ↗

Vergleich von vier Coding-Agenten-Varianten am ARC-AGI-3-Benchmark, wobei die Verifikationsvariante rund 99 % RHAE erzielt

Sergey Rodionov testet vier verschachtelte Varianten Codex-basierter Agenten am Benchmark ARC-AGI-3, um den Beitrag eines ausführbaren Weltmodells, der Vereinfachung und der Verifikation zu ermitteln. Die Verifikationsvariante schneidet in allen Konfigurationen am besten ab und löst mit dem Modell gpt-5.6-sol jedes öffentliche Spiel auf beiden Reasoning-Effort-Stufen vollständig, mit rund 99 % RHAE.

🤖

Dieser Artikel wurde mithilfe von künstlicher Intelligenz aus Primärquellen erstellt.

Was ist ARC-AGI-3, und welche Agentenvarianten testet Sergey Rodionov?

ARC-AGI-3 ist ein Benchmark für allgemeine Intelligenz, der Aufgaben als interaktive Spiele gestaltet — der Agent muss die Regeln der Umgebung entdecken und innerhalb dieser handeln, statt statische Rätsel wie in früheren ARC-Versionen zu lösen. Sergey Rodionov testet vier verschachtelte Varianten Codex-basierter Agenten (Agenten, die auf dem Ansatz von OpenAIs Codex zur Code-Generierung und -Ausführung aufbauen), um den Beitrag dreier Fähigkeiten zu isolieren: ein ausführbares Weltmodell — ein interner Simulator, der Konsequenzen von Aktionen durch Codeausführung statt durch textuelles Erraten vorhersagt —, Aufgabenvereinfachung und die explizite Verifikation des Ergebnisses vor dem endgültigen Zug.

Die Verifikationsvariante gewinnt in allen Konfigurationen

Die Verifikationsvariante, die vor jedem Zug die eigene Lösung gegen ein internes Modell der Umgebung prüft, erweist sich in allen getesteten Konfigurationen als die beste — allerdings bei deutlich höherem Rechenressourcenverbrauch als die anderen drei Varianten. Dieser Kompromiss ist erwartbar: Der zusätzliche Verifikationsschritt bedeutet zusätzliche Modellaufrufe und längere Ausführungszeit pro Aufgabe, doch das Ergebnis rechtfertigt den Aufwand.

Die Verifikationsvariante löst das gesamte öffentliche Spiele-Set

Mit dem Modell gpt-5.6-sol löst die Verifikationsvariante jedes öffentliche Spiel in ARC-AGI-3 auf beiden getesteten Reasoning-Effort-Stufen (niedrigerer und höherer Grad rechnerischen „Nachdenkens” vor einem Zug) vollständig und erreicht dabei rund 99 % RHAE — eine Metrik, die den Anteil erfolgreich gelöster Aktionen im Verhältnis zur Gesamtzahl der Versuche misst. Rodionov beschreibt dies als „Sättigung des öffentlichen Sets”, also einen Zustand, in dem der Benchmark leistungsfähigere Agenten nicht mehr unterscheidet, weil er nahezu vollständig gelöst ist.

Sättigung des öffentlichen Sets und die Zukunft des Benchmarks

Der Autor warnt, dass die Held-out-Leistung — Ergebnisse am verborgenen, nicht öffentlichen Spiele-Set — mit einem neueren Modell wie gpt-5.6-sol ungetestet bleibt, sodass sich die tatsächliche Fähigkeitsgrenze der Agenten nicht aus öffentlichen Ergebnissen bestimmen lässt. Die Sättigung des öffentlichen Teils von ARC-AGI-3 signalisiert, dass künftige Benchmarks sich auf verborgene Evaluierungen stützen müssen, um ihren diskriminativen Wert zu behalten.

Häufig gestellte Fragen

Was ist ARC-AGI-3?
ARC-AGI-3 ist ein Benchmark für allgemeine Intelligenz, der Aufgaben als interaktive Spiele darstellt, bei denen der Agent die Regeln der Umgebung entdecken und innerhalb dieser handeln muss.
Was ist ein ausführbares Weltmodell?
Das ist ein interner Simulator, der durch Codeausführung die Konsequenzen der Aktionen eines Agenten vor dem eigentlichen Zug vorhersagt, statt dass sich das Modell auf textuelles Erraten der Ergebnisse verlässt.
Welche Agentenvariante war am erfolgreichsten und warum?
Die Verifikationsvariante, die eine Lösung vor dem Zug überprüft, war mit dem Modell gpt-5.6-sol in allen Konfigurationen am besten und erzielte rund 99 % RHAE bei deutlich höherem Ressourcenverbrauch.

📬 KI-News in dein Postfach

Ein täglicher Digest nach deinen Regeln — Themen, Quellen und Rhythmus wählbar. Abmeldung mit einem Klick.