
DisCo
DisCo ist eine Trainingsmethode für KI-Sprachmodelle, bei der zwei Modelle zusammenarbeiten: eines erzeugt Antworten, das andere bewertet sie und gibt Feedback zurück. Ziel ist es, die Qualität und Verlässlichkeit der Ausgaben zu verbessern, ohne dafür große Mengen menschlicher Bewertungen zu benötigen.
DisCo steht für « Discriminator-Cooperator » und beschreibt ein Verfahren, bei dem zwei KI-Modelle gemeinsam trainiert werden. Das eine Modell — der Generator — formuliert Antworten oder Texte. Das andere — der Diskriminator, also ein Bewertungsmodell — prüft diese Ausgaben und urteilt, ob sie gut oder schlecht sind. Dieses Urteil fließt direkt zurück an den Generator, der sich daraufhin verbessert. Beide Modelle lernen also nicht unabhängig voneinander, sondern durch ihre Zusammenarbeit. Das Besondere: Dieser Rückkopplungskreis kann weitgehend automatisch laufen, ohne dass bei jedem Schritt ein Mensch eingreifen muss.
Warum der Feedback-Kreislauf so wertvoll ist
Das klassische Problem beim Verbessern von Sprachmodellen ist Aufwand. Menschen müssen Tausende von Modellantworten lesen und bewerten — das kostet Zeit und Geld. Je größer das Modell, desto mehr Bewertungen braucht man, um es zuverlässig zu steuern. DisCo versucht, diesen Engpass zu umgehen.
Weil der Diskriminator das Feedback automatisch liefert, kann der Generator viel häufiger korrigiert werden als durch menschliche Bewerter allein. Das ist vergleichbar mit einem Schüler, der nicht nur einmal im Monat eine Note bekommt, sondern nach jedem einzelnen Satz eine Rückmeldung erhält. Lernen geht so schneller und gezielter. Gleichzeitig bleibt die Frage, wie gut der Diskriminator selbst ist — ein schlechter Bewerter gibt schlechtes Feedback, und der Generator lernt dann in die falsche Richtung.
Das Zusammenspiel von Generator und Diskriminator
Im Training läuft der Prozess in Runden ab. Der Generator produziert einen Text. Der Diskriminator weist diesem Text eine Punktzahl zu — etwa dafür, wie korrekt, kohärent oder hilfreich er ist. Diese Punktzahl wird in ein Signal umgerechnet, das dem Generator sagt, welche seiner Entscheidungen gut waren und welche er künftig vermeiden soll. Dann beginnt die nächste Runde.
Wichtig ist, dass der Diskriminator selbst auch trainiert wird — oft an einem kleineren Satz echter menschlicher Urteile. Er lernt also, was Menschen als gute Antwort betrachten würden, und überträgt dieses Wissen dann im großen Maßstab auf den Generator. Man bezeichnet das manchmal als « gelerntes Belohnungssignal », weil die Belohnung nicht von Hand vergeben, sondern von einem Modell berechnet wird.
DisCo ist damit verwandt mit einer breiter bekannten Technik namens Reinforcement Learning from Human Feedback — kurz RLHF — bei der menschliche Bewertungen ebenfalls genutzt werden, um ein Belohnungsmodell zu trainieren. Der Unterschied liegt im Detail: DisCo betont stärker die direkte Kooperation beider Modelle während des Trainings und kann in bestimmten Varianten ganz ohne externe Belohnungsmodelle auskommen.
DisCo in der Praxis und in den News
DisCo taucht vor allem in der Forschung rund um große Sprachmodelle auf — also die Art von Modellen, die hinter Chatbots wie ChatGPT oder Gemini stecken. Labore suchen ständig nach Wegen, solche Modelle sicherer und nützlicher zu machen, ohne dafür unbegrenzte Mengen an menschlichen Bewertungsdaten zu benötigen. DisCo ist ein Ansatz in diesem Suchfeld.
In Tech-Berichten begegnet man dem Begriff häufig im Zusammenhang mit sogenanntem « alignment » — dem Bestreben, Modelle so zu trainieren, dass sie das tun, was Menschen von ihnen erwarten, statt nur statistisch plausible Antworten zu liefern. DisCo ist dabei kein fertiges Produkt, das man kaufen kann, sondern eine Methode, die Unternehmen und Universitäten in ihre eigenen Trainingsabläufe einbauen.
Wer Meldungen über neue Modellversionen liest und sich fragt, wie die Hersteller ihre Modelle zwischen zwei Versionen so deutlich verbessert haben, stößt oft auf Trainingsverfahren dieser Art. DisCo ist eine der Antworten auf die Frage, wie man ein Modell schnell und kostengünstig auf ein höheres Qualitätsniveau heben kann.