GRPO

GRPO

GRPO ist ein Trainingsverfahren, das KI-Modelle durch Belohnungssignale verbessert – ohne dafür ein zweites, aufwendiges Hilfsmodell zu benötigen. Es wurde durch den Einsatz in DeepSeeks R1-Modell bekannt und gilt als besonders ressourcenschonende Alternative zu älteren Methoden.

Ein KI-Modell wird zunächst darauf trainiert, Texte vorherzusagen. Das macht es sprachlich flüssig, aber noch nicht besonders nützlich oder verlässlich. Um es gezielt auf gute Antworten hinzutrainieren, braucht man eine weitere Phase: Das Modell bekommt Rückmeldungen, welche Antworten besser und welche schlechter sind – ähnlich wie Schulnoten. GRPO, kurz für Group Relative Policy Optimization, ist ein konkretes Verfahren für genau diese Phase. Es gehört zur Familie der sogenannten Reinforcement-Learning-Methoden, also Lernverfahren, die mit Belohnungen und Bestrafungen arbeiten. Das Besondere an GRPO ist, wie es diese Bewertungen berechnet: nicht absolut, sondern immer im Vergleich zu einer Gruppe von Antworten auf dieselbe Frage.

Warum GRPO den Unterschied macht

Ältere Verfahren derselben Familie – etwa PPO, das lange als Standard galt – brauchen neben dem eigentlichen Modell ein zweites, fast genauso großes Hilfsmodell. Dieses sogenannte Critic-Modell schätzt laufend ein, wie gut eine Antwort war. Das kostet enorm viel Rechenleistung und Arbeitsspeicher.

GRPO kommt ohne dieses Hilfsmodell aus. Stattdessen rechnet es die Bewertung direkt aus der Gruppe der verglichenen Antworten heraus. Das klingt nach einem technischen Detail, hat aber erhebliche Folgen: Modelle, für die PPO zu teuer wäre, können mit GRPO überhaupt erst trainiert werden. Das Verfahren öffnet aufwendige Trainingsformen auch für kleinere Forschungsgruppen und Unternehmen, die keine riesigen Rechenzentren betreiben.

Das Gruppenprinzip hinter GRPO

Der Name verrät die Funktionsweise: Für eine einzige Frage erzeugt das Modell mehrere Antworten gleichzeitig – eine Gruppe. Jede Antwort bekommt eine Bewertung von einer externen Quelle, dem sogenannten Reward Model oder einer regelbasierten Prüfung. Dann berechnet GRPO, welche Antworten innerhalb dieser Gruppe besser als der Durchschnitt waren und welche schlechter.

Das Modell wird anschließend so angepasst, dass es überdurchschnittliche Antworten künftig häufiger produziert. Ein wichtiger Unterschied zu einfacheren Ansätzen: Das Modell vergleicht sich immer mit sich selbst, nicht mit einem festen Zielpunkt. Dadurch passt sich das Training automatisch an den aktuellen Leistungsstand an. Ein Modell, das schon gut ist, muss sich an einer hohen Messlatte behaupten.

Damit das Training stabil bleibt, verhindert GRPO außerdem, dass sich das Modell zu schnell und zu stark verändert. Es gibt eine Art Abstandsregel: Jeder Trainingsschritt darf das Verhalten des Modells nur bis zu einem definierten Grad verschieben. Das bewahrt davor, dass das Modell früher gelerntes Wissen überschreibt, nur weil eine einzelne Trainingsfrage einen starken Ausschlag gibt.

GRPO in der Praxis – DeepSeek und die Folgen

Bekannt wurde GRPO Anfang 2025, als das chinesische KI-Labor DeepSeek bekanntgab, das Verfahren für sein Modell DeepSeek-R1 eingesetzt zu haben. R1 erzielte bei mathematischen und logischen Aufgaben Ergebnisse, die mit deutlich teureren Modellen mithalten konnten. Da DeepSeek gleichzeitig seinen Programmcode veröffentlichte, konnten andere Forschungsgruppen GRPO direkt nachbauen und in eigene Projekte übernehmen.

Seitdem taucht GRPO in Fachartikeln und Tech-News regelmäßig auf, wenn es um sogenannte Reasoning-Modelle geht – also Modelle, die nicht einfach eine Antwort ausgeben, sondern einen Lösungsweg in mehreren Schritten durchdenken. GRPO eignet sich für diesen Zweck besonders gut, weil die Qualität solcher Schritte gut mit Regeln prüfbar ist: Eine mathematische Herleitung ist entweder korrekt oder falsch, man braucht kein menschliches Urteil für jede einzelne Zeile.

Für die breitere KI-Entwicklung ist GRPO ein Beispiel dafür, dass der entscheidende Fortschritt manchmal nicht durch mehr Rechenleistung entsteht, sondern durch eine clevere Vereinfachung eines bestehenden Verfahrens. Wer über die Trainingskosten großer Sprachmodelle liest, stößt auf GRPO als einen der Gründe, warum diese Kosten zuletzt deutlich gesunken sind.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.