
CORE-Bench
CORE-Bench ist ein Benchmark — also ein standardisierter Test — der misst, wie gut KI-Systeme wissenschaftliche Forschungsergebnisse selbstständig nachvollziehen und reproduzieren können. Er bewertet damit eine Fähigkeit, die für den Einsatz von KI in der Wissenschaft besonders kritisch ist.
Wissenschaftliche Studien sind nur dann verlässlich, wenn andere sie wiederholen und zum gleichen Ergebnis kommen können. Das nennt man Reproduzierbarkeit. CORE-Bench ist ein Test, der misst, ob KI-Systeme dazu in der Lage sind: Sie sollen den Programmcode und die Daten einer echten Studie nehmen und die veröffentlichten Ergebnisse selbstständig nachrechnen. Der Benchmark stammt aus dem Jahr 2024 und umfasst Hunderte von Aufgaben aus verschiedenen wissenschaftlichen Disziplinen, darunter Informatik, Wirtschaftswissenschaften und Medizin. Jede Aufgabe basiert auf einer echten, veröffentlichten Studie mit öffentlich zugänglichem Code.
Reproduzierbarkeit als Messlatte für wissenschaftliche KI
Viele KI-Systeme können Texte zusammenfassen oder Fragen beantworten. Eine andere Sache ist es, den Rechenweg einer Studie lückenlos nachzuvollziehen. Dafür muss das System Code ausführen, Abhängigkeiten installieren, Fehler beheben und am Ende prüfen, ob die Zahlen stimmen. Das ist eine Kombination aus technischem Verständnis und planerischem Vorgehen.
Warum das relevant ist: Viele Studien lassen sich von Menschen schon schwer reproduzieren — fehlende Pakete, undokumentierte Schritte, veraltete Software. Wenn ein KI-System das zuverlässig schafft, könnte es Forschern einen erheblichen Teil dieser Arbeit abnehmen. CORE-Bench macht diesen Fortschritt erstmals messbar und vergleichbar.
Aufbau und Schwierigkeitsgrade des Tests
CORE-Bench unterteilt seine Aufgaben in drei Schwierigkeitsstufen. Die einfachste Stufe fragt nur, ob das System versteht, welche Ergebnisse eine Studie überhaupt enthält. Die mittlere Stufe verlangt, dass das System den Code ausführt, aber die Umgebung — also Programme und Bibliotheken — ist bereits eingerichtet. Auf der schwersten Stufe muss das System alles von Grund auf selbst aufsetzen und dann die richtigen Zahlen liefern.
Bewertet wird das Ergebnis, nicht der Weg. Wenn die vom KI-System berechneten Werte mit den Werten aus der Originalstudie übereinstimmen, gilt die Aufgabe als gelöst. Das klingt einfach, ist es aber nicht: Selbst die leistungsstärksten Systeme scheitern auf der höchsten Stufe bei einem Großteil der Aufgaben. Beim Erscheinen des Benchmarks löste das beste getestete System etwa 21 Prozent der schwierigsten Aufgaben — ein ernüchterndes Ergebnis, das zeigt, wie weit KI von echter wissenschaftlicher Eigenständigkeit noch entfernt ist.
Der Benchmark setzt sogenannte KI-Agenten ein — also Systeme, die nicht nur Text ausgeben, sondern aktiv Werkzeuge benutzen, Code schreiben und ausführen sowie selbstständig Entscheidungen treffen. Klassische Chatbots wären für diese Aufgabe grundsätzlich ungeeignet.
CORE-Bench in der Forschungsdebatte und in Produkten
CORE-Bench taucht vor allem in Diskussionen über sogenannte KI-Agenten auf — Systeme, die selbstständig mehrstufige Aufgaben erledigen sollen. Unternehmen wie OpenAI, Google und Anthropic entwickeln solche Agenten und brauchen objektive Tests, um ihren Fortschritt zu dokumentieren. CORE-Bench ist einer der wenigen Benchmarks, der eine klar nachprüfbare Aufgabe aus der echten Welt stellt: Entweder stimmen die Zahlen, oder sie stimmen nicht.
In der Wissenschaftspolitik wird CORE-Bench als Argument in der Debatte um die sogenannte Replikationskrise genutzt. Viele Fachgebiete, besonders die Psychologie und Teile der Medizin, kämpfen damit, dass sich veröffentlichte Studien häufig nicht bestätigen lassen. Wenn KI-Systeme die Reproduzierbarkeit automatisch überprüfen könnten, wäre das ein konkretes Werkzeug gegen dieses Problem.
Für Leserinnen und Leser von Tech-News begegnet CORE-Bench meist dann, wenn neue Agentenmodelle vorgestellt werden und Hersteller ihre Ergebnisse auf verschiedenen Benchmarks ausweisen. Er gilt als besonders aussagekräftig, weil er keine Multiple-Choice-Fragen stellt, sondern reale, komplexe Arbeit verlangt.