
Destillation
Destillation ist ein Verfahren, bei dem ein großes, teures KI-Programm einem kleinen beibringt, dieselben Aufgaben zu lösen. Das Ergebnis ist ein schlankeres Modell, das fast so gut antwortet, aber deutlich weniger Rechenleistung braucht.
Programme wie ChatGPT beantworten Fragen, weil sie vorher an riesigen Textmengen geübt haben. Solche Programme nennt man Modelle. Die leistungsfähigsten davon sind sehr groß und brauchen teure Spezialcomputer, um überhaupt zu laufen. Bei der Destillation lässt man ein solches großes Modell ein kleines anlernen: Das große beantwortet tausende Beispielfragen, das kleine übt daran, dieselben Antworten zu geben. Das Ergebnis ist ein schlankes Modell, das einen großen Teil der Fähigkeiten übernommen hat. Der Name ist an das Destillieren in der Chemie angelehnt, bei dem man aus einer Flüssigkeit das Wesentliche herauszieht.
Warum kleine Modelle plötzlich interessant wurden
Große Modelle sind im Betrieb teuer. Jede einzelne Antwort kostet Strom und Rechenzeit auf Grafikchips, die mehrere zehntausend Euro pro Stück kosten. Wer einen Dienst mit Millionen Nutzern betreibt, zahlt diese Kosten jeden Tag neu. Ein destilliertes Modell kann dieselbe Aufgabe oft für einen Bruchteil des Preises erledigen.
Dazu kommt die Größe. Ein sehr großes Modell passt nur in ein Rechenzentrum, ein destilliertes manchmal auf ein Notebook oder sogar ein Smartphone. Dann muss die Frage das Gerät gar nicht verlassen. Das ist schneller und für Daten günstiger, die niemand ins Internet schicken möchte, etwa Krankenakten oder interne Firmenunterlagen.
Destillation verschiebt außerdem die Machtverhältnisse in der Branche. Wer ein Spitzenmodell mit riesigem Aufwand trainiert hat, muss damit rechnen, dass ein Konkurrent es abfragt und daraus ein billiges Nachbau-Modell zieht. Genau deshalb verbieten viele Anbieter in ihren Nutzungsbedingungen ausdrücklich, ihre Antworten zum Training eigener Modelle zu verwenden.
Lehrer und Schüler im Training
Die beiden Beteiligten heißen üblicherweise Lehrermodell und Schülermodell. Das Schülermodell ist von Anfang an kleiner gebaut, es hat weniger interne Stellschrauben. Man schickt beiden dieselben Aufgaben und vergleicht die Ausgaben. Der Schüler wird so lange nachjustiert, bis seine Antworten denen des Lehrers stark ähneln.
Entscheidend ist dabei ein Detail. Ein Sprachmodell gibt nicht nur ein Wort aus, sondern für viele mögliche Wörter eine Wahrscheinlichkeit. Der Lehrer verrät damit, wie sicher er sich ist und welche Alternativen er fast genauso gut fand. Diese Zwischentöne enthalten mehr Information als eine bloße Musterlösung. Deshalb lernt ein Schülermodell aus Lehrerantworten oft schneller als aus normalen Trainingstexten.
Perfekt wird die Kopie trotzdem nicht. Ein destilliertes Modell ist meist stark in den Bereichen, die in den Übungsfragen vorkamen, und schwächer außerhalb davon. Auch Fehler des Lehrers werden mitgelernt. Und Destillation ist etwas anderes als Quantisierung: Dort behält man das Modell und speichert nur seine Zahlen gröber. Bei der Destillation entsteht dagegen ein komplett neues, kleineres Modell.
Destillierte Modelle in Produkten und Schlagzeilen
Viele Anbieter verkaufen ihre Modelle in Größenstufen, oft mit Namen wie Mini, Flash oder Lite. Diese günstigen Varianten sind häufig destillierte Versionen des großen Modells. Für Standardaufgaben wie Zusammenfassen oder Übersetzen reichen sie meistens aus. Nur bei komplizierten Aufgaben greift man dann noch auf das teure Spitzenmodell zurück.
Auch auf dem Handy steckt die Technik drin. Automatische Übersetzung ohne Internet, Tastaturvorschläge oder Sprachbedienung laufen oft auf destillierten Modellen. Sie müssen klein genug sein, um in den Speicher zu passen und den Akku nicht zu leeren.
In den Nachrichten taucht der Begriff meist in zwei Zusammenhängen auf. Entweder feiert eine Firma, dass ihr kleines Modell fast die Werte des großen erreicht. Oder es gibt Streit, weil ein Unternehmen einem anderen vorwirft, sein Modell heimlich abdestilliert zu haben. Solche Vorwürfe sind schwer zu beweisen, weil man dem fertigen Schülermodell nicht ansieht, woher seine Übungsantworten stammten.