
FrontierMath
FrontierMath ist eine Sammlung extrem schwerer, bisher unveröffentlichter Mathematikaufgaben, an denen KI-Systeme gemessen werden. Sie wurde 2024 vom Forschungsinstitut Epoch AI zusammengestellt, weil die üblichen Mathe-Tests für moderne Modelle zu leicht geworden waren.
FrontierMath ist eine Sammlung von Mathematikaufgaben, mit denen man Computerprogramme prüft, die Fragen beantworten können. Solche Aufgabensammlungen nennt man Benchmark: alle Systeme bekommen dieselben Aufgaben, und man vergleicht, wie viele sie richtig lösen. Das Besondere an FrontierMath ist die Schwierigkeit. Die Aufgaben stammen von Berufsmathematikerinnen und Berufsmathematikern, und manche davon würden auch einen Fachmann tagelang beschäftigen. Veröffentlicht wurde die Sammlung Ende 2024 von der Forschungsgruppe Epoch AI. Sie entstand, weil ältere Mathe-Tests von den Programmen inzwischen fast vollständig gelöst wurden und deshalb nichts mehr unterscheiden konnten.
Warum alte Mathe-Tests ihren Zweck verloren haben
Jahrelang war GSM8K der übliche Maßstab: Textaufgaben auf Grundschul- bis Mittelstufenniveau. Später kam MATH dazu, mit Aufgaben aus Wettbewerben für Oberstufenschüler. Beide Sammlungen werden von heutigen Sprachmodellen zu über neunzig Prozent gelöst. Ein Test, den fast alle bestehen, sagt nichts mehr über Unterschiede aus. Fachleute nennen das Sättigung eines Benchmarks.
Dazu kommt ein zweites Problem. Die alten Aufgaben stehen seit Jahren im Internet, samt Lösungen. KI-Modelle lernen aus riesigen Textmengen aus dem Netz. Es lässt sich also kaum unterscheiden, ob ein Modell die Aufgabe wirklich löst oder die Lösung aus dem Training wiedergibt. Dieses Problem heißt Datenkontamination.
FrontierMath umgeht beides. Die Aufgaben sind neu geschrieben und werden bewusst nicht veröffentlicht. Und sie sind so schwer, dass die besten Systeme lange nur einen kleinen einstelligen Prozentsatz lösten. Damit gibt es wieder Raum nach oben, an dem sich Fortschritt ablesen lässt.
Aufgaben, die sich selbst kontrollieren
Jede FrontierMath-Aufgabe hat eine eindeutige Antwort, etwa eine Zahl oder ein mathematisches Objekt, das ein Programm überprüfen kann. Das ist wichtig, weil ein Mensch sonst jede einzelne Lösung von Hand nachrechnen müsste. Gleichzeitig sollen die Antworten nicht erratbar sein. Deshalb sind es oft sehr große oder sehr spezielle Werte, bei denen Raten praktisch aussichtslos ist.
Die Aufgaben decken viele Gebiete ab, von Zahlentheorie über algebraische Geometrie bis zu Kombinatorik. Ein Teil verlangt echte Beweisideen, ein anderer Teil sehr aufwendige Rechnungen. Getestete Systeme dürfen dabei meist Programmcode schreiben und ausführen. Ein Modell kann also rechnen lassen, statt alles im Kopf zu machen, ähnlich wie ein Mathematiker den Computer benutzt.
Damit die Sammlung sauber bleibt, hält Epoch AI die Aufgaben unter Verschluss. Ein kleiner Teil ist als Beispiel öffentlich, der Rest nicht. Kritisch diskutiert wurde, dass das Projekt teilweise von OpenAI finanziert wurde und das Unternehmen Zugriff auf Aufgaben hatte. Ein Benchmark ist nur so glaubwürdig wie die Unabhängigkeit seiner Prüfer, und genau darum drehte sich die Debatte.
FrontierMath in Modellankündigungen und Nachrichten
Der Name taucht vor allem auf, wenn ein Labor ein neues Spitzenmodell vorstellt. In den Präsentationsfolien stehen dann Balkendiagramme mit Prozentwerten, und FrontierMath ist einer davon. Wer solche Zahlen liest, sollte auf die Bedingungen achten. Wie viele Versuche pro Aufgabe waren erlaubt, durfte das Modell Code ausführen, wie lange durfte es rechnen? Ohne diese Angaben sind zwei Prozentwerte nicht vergleichbar.
Für Anlegerinnen und Anleger ist der Benchmark ein Indikator dafür, wie schnell sich die Fähigkeiten von KI-Systemen im logischen Denken verbessern. Sprünge von wenigen Prozent auf mehrere Dutzend Prozent innerhalb eines Jahres wurden als Beleg für rasanten Fortschritt gewertet und bewegten Aktienkurse.
Ein verbreiteter Irrtum ist, ein hoher Wert bei FrontierMath bedeute allgemeine Intelligenz. Der Test misst eine sehr enge Fähigkeit: schwere, klar gestellte Mathematikprobleme mit eindeutiger Antwort. Alltagsurteil, Zuverlässigkeit oder Ehrlichkeit eines Modells sagt er nicht voraus. Deshalb steht FrontierMath in Berichten fast immer neben anderen Tests, etwa zu Programmieren oder naturwissenschaftlichem Wissen.