
Loop-Korrektur
Eine Loop-Korrektur ist ein Mechanismus, mit dem ein KI-System seine eigene Ausgabe überprüft und verbessert, bevor es eine endgültige Antwort liefert. Das Modell durchläuft dabei mehrere Runden der Selbstkritik, statt eine Antwort in einem einzigen Schritt zu erzeugen.
Ein KI-Sprachmodell erzeugt normalerweise eine Antwort in einem einzigen Durchlauf: Eingabe rein, Ausgabe raus. Eine Loop-Korrektur ändert diesen Ablauf. Das Modell erzeugt zunächst eine erste Antwort, bewertet sie dann selbst auf Fehler oder Lücken und verbessert sie anschließend. Dieser Zyklus — erzeugen, prüfen, überarbeiten — kann mehrfach wiederholt werden. Am Ende steht eine Antwort, die das Modell in mehreren Runden durchgearbeitet hat, statt sie einmalig auszuspucken.
Warum ein einziger Durchlauf oft nicht reicht
Sprachmodelle sind darauf trainiert, Token für Token — also Wort für Wort — vorherzusagen. Sie planen dabei nicht wie ein Mensch, der einen Aufsatz entwirft, verwirft und überarbeitet. Sie folgen dem wahrscheinlichsten nächsten Wort. Das führt dazu, dass Fehler, die früh im Text passieren, bis zum Ende mitgeschleppt werden, weil das Modell seinen eigenen Anfang nicht mehr korrigiert.
Bei einfachen Aufgaben fällt das kaum auf. Bei mehrstufigen Problemen — langen Rechenaufgaben, logischen Schlüssen oder komplexem Code — summieren sich kleine Fehler schnell. Loop-Korrekturen sind ein Versuch, dieses strukturelle Problem zu umgehen, ohne das Modell von Grund auf neu zu trainieren.
Wie ein Korrekturzyklus abläuft
Im einfachsten Fall gibt man dem Modell nach seiner ersten Antwort eine zweite Anweisung: „Überprüfe deine Antwort auf Fehler und verbessere sie.“ Das Modell liest seine eigene Ausgabe wie einen fremden Text und kommentiert sie. Anschließend erzeugt es eine korrigierte Version. In aufwändigeren Systemen übernimmt ein zweites, separates Modell die Prüfrolle — ähnlich wie ein Redakteur, der den Text eines Journalisten abnimmt.
Wichtig ist, dass das Modell beim Prüfen andere Fehler findet als beim Erzeugen. Wer selbst schreibt und sofort Korrektur liest, übersieht leicht, was er meinte statt was dasteht. Deshalb hilft es, zwischen Erzeugungs- und Prüfschritt eine klare Rolltrennung einzubauen — entweder durch spezielle Anweisungen oder durch ein zweites Modell.
Ein bekanntes Verfahren aus der Forschung heißt Self-Refine. Dabei wird das Modell systematisch dazu gebracht, Feedback zu seiner eigenen Ausgabe zu formulieren und dann auf Basis dieses Feedbacks eine neue Version zu schreiben. In Tests schnitt Self-Refine bei Aufgaben wie Codeschreiben oder Textoptimierung deutlich besser ab als ein einzelner Durchlauf ohne Korrekturschleife.
Loop-Korrekturen in aktuellen KI-Produkten
Wer GPT-4o oder Claude gebeten hat, einen Fehler zu finden und den Code zu reparieren, hat Loop-Korrekturen im Ansatz erlebt. In sogenannten KI-Agenten — Systemen, die selbstständig Aufgaben abarbeiten — sind Korrekturschleifen fest eingebaut. Der Agent führt eine Aktion aus, prüft das Ergebnis und entscheidet, ob er weitermacht oder nochmals ansetzt.
OpenAIs o1- und o3-Modelle sowie das chinesische Modell DeepSeek-R1 nutzen eine verwandte Idee: Sie denken vor der Antwort in einer langen internen Kette nach, die Selbstkorrekturen enthält. Was im Chat als kurze Antwort erscheint, ist das Ergebnis vieler interner Iterationsschritte. Diese Modelle liegen bei Mathematik- und Programmierwettbewerben deshalb deutlich vor Modellen, die ohne solche Schleifen arbeiten.
Der Preis ist Zeit und Rechenaufwand. Jede zusätzliche Runde kostet Geld und verlängert die Wartezeit. Systeme mit Loop-Korrekturen brauchen deshalb eine kluge Abbruchbedingung: Wann ist gut gut genug? Sonst dreht das Modell endlos im Kreis — und verbessert irgendwann nichts mehr.