Self-Play

Self-Play

Self-Play ist eine Trainingsmethode, bei der ein KI-System nicht gegen menschliche Gegner, sondern gegen Kopien seiner selbst trainiert. So kann es sich unbegrenzt lange verbessern, ohne auf menschliches Feedback angewiesen zu sein.

Damit ein KI-System besser wird, braucht es Gegner oder Gesprächspartner, die es herausfordern. Menschen können das übernehmen — aber Menschen sind langsam, teuer und irgendwann nicht mehr gut genug. Self-Play löst dieses Problem: Das System spielt oder trainiert gegen eine Kopie seiner selbst. Wird es besser, wird automatisch auch der Gegner besser — denn Gegner und Trainierender sind dasselbe Modell. Dieser Kreislauf kann ohne Pause und ohne menschliche Beteiligung laufen.

Warum Self-Play so mächtig ist

Menschliches Training hat eine natürliche Obergrenze: Irgendwann ist kein Mensch mehr in der Lage, das Modell zu besiegen oder sinnvoll zu korrigieren. Self-Play kennt diese Grenze nicht. Das System kann sich theoretisch über menschliche Fähigkeiten hinaus steigern, solange die Aufgabe ein klares Erfolgskriterium hat — zum Beispiel eine Spielregel, die eindeutig sagt, wer gewonnen hat.

Dazu kommt die schiere Geschwindigkeit. Ein Mensch schafft vielleicht einige Dutzend Trainingspartien am Tag. Ein KI-System spielt in derselben Zeit Millionen von Runden gegen sich selbst. Das erlaubt eine Breite an Erfahrung, die kein menschlicher Trainer je liefern könnte.

Der Mechanismus hinter dem Kreislauf

Am Anfang steht ein Modell, das noch zufällig oder sehr schlecht spielt. Es tritt gegen eine Kopie seiner selbst an. Nach jeder Partie wertet es aus, welche Züge oder Entscheidungen zum Sieg geführt haben, und passt seine inneren Gewichte — also die gespeicherten Erfahrungswerte — entsprechend an. Dann wird die Kopie auf den neuen Stand gebracht, und das Spiel beginnt von vorn.

Wichtig dabei ist, dass der Gegner nicht immer sofort auf denselben Stand gebracht wird wie das lernende Modell. Oft behält man ältere Versionen, um eine zu große Spezialisierung zu vermeiden. Würden sich zwei absolut identische Kopien gegenüberstehen, lernten sie nur, den jeweils aktuellen Stand zu besiegen — aber keine allgemeinen Strategien.

Technisch ist Self-Play eine Form des bestärkenden Lernens, also einer Trainingsart, bei der das Modell durch Belohnungssignale lernt. Das Besondere ist, dass diese Belohnung ausschließlich aus dem Ergebnis der Partie stammt — kein Mensch muss sagen, welcher Zug gut war.

Self-Play in Produkten und Schlagzeilen

Der bekannteste Einsatz ist AlphaGo, das 2016 den weltbesten Spieler im Brettspiel Go schlug. Dessen Nachfolger AlphaZero lernte Go, Schach und Shogi ausschließlich durch Self-Play — ohne je eine menschliche Partie gesehen zu haben. Nach wenigen Stunden Training übertraf es menschliche Weltmeister in allen drei Spielen.

Self-Play beschränkt sich längst nicht mehr auf Brettspiele. OpenAI nutzte es, um Roboterarme zu trainieren, die Würfel in einer simulierten Umgebung manipulieren. Und auch bei großen Sprachmodellen taucht das Prinzip auf: Neuere Trainingsansätze lassen Modelle ihre eigenen Antworten bewerten und gegeneinander abwägen — eine Art Self-Play ohne klassischen Gegner.

Eine wichtige Einschränkung bleibt aber bestehen: Self-Play funktioniert nur dort, wo ein eindeutiges Gütekriterium existiert. Bei einem Schachprogramm ist das klar — gewonnen oder verloren. Bei Aufgaben wie „Schreibe einen guten Aufsatz“ gibt es kein solches Kriterium. Deshalb ist Self-Play im Sprachbereich schwieriger umzusetzen und bleibt ein aktives Forschungsfeld.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.