

ARC-AGI-3
#27 in Reasoning-ModelleUnknown · v3 · seit 25. März 2026 · 2× · zuletzt 02. Okt. 2026
18
Momentum
ARC-AGI-3 ist ein interaktiver Reasoning-Benchmark der ARC Prize Foundation, der KI-Agenten in neuartigen, textfreien Spielumgebungen testet. Statt statischer Rätsel müssen Agenten ohne Anleitung Regeln erkunden, Ziele ableiten, Weltmodelle bilden und über mehrere Level hinweg lernen. Der Benchmark umfasst hunderte handgefertigte, rundenbasierte Umgebungen; Menschen erreichen 100%, während Frontier-KI-Systeme beim Launch unter 1% lagen. Zugriff erfolgt über eine offene REST-API und ein Python-Toolkit (MIT-Lizenz), Ergebnisse werden auf einem öffentlichen Leaderboard veröffentlicht.
Momentum-Verlauf
04.07.02.10.
Features
| Key-Benchmark (%) | Bestwert (Leaderboard, Sep. 2026): GPT-6 Astra 62,7% (teils 99,9% je Harness); Menschen 100%; Frontier-KI bei Launch 0,51% |
| Lizenz | ARC-AGI Toolkit/Benchmarking-Code: MIT-Lizenz; Wettbewerbsbeiträge müssen CC0/MIT-0 sein; privates Testset restriktiv |
| Multimodalität | Visuell/interaktiv: 2D-Pixelgitter-Spielumgebungen (z.B. 64x64), keine Sprachanweisungen, Agenten handeln über Aktionen in Echtzeit |
| Plattform | Web-Spiel unter arcprize.org/tasks; Zugriff für Agenten über REST-API und Python-Toolkit (arcprize/ARC-AGI auf GitHub) |
| Release-Datum | 25. März 2026 (offizieller Launch) |