Decoder-only-Modell

Decoder-only-Modell

Ein Decoder-only-Modell ist eine Bauform von Sprachmodellen, die Text Wort für Wort von links nach rechts erzeugt und dabei immer nur auf das bereits Geschriebene zurückblickt. Die meisten bekannten Chatbots, darunter ChatGPT und Gemini, basieren auf genau diesem Prinzip.

Ein Decoder-only-Modell ist eine bestimmte Art, ein Sprachmodell aufzubauen. Es erzeugt Text Wort für Wort — immer von links nach rechts. Dabei schaut es jeweils nur auf das zurück, was bereits geschrieben wurde, nie auf das, was noch kommt. Dieses Prinzip klingt simpel, steckt aber hinter den meisten großen Sprachmodellen der Gegenwart: GPT-4, Gemini, LLaMA und viele weitere folgen alle diesem Bauplan. Der Name kommt daher, dass ältere Modelle aus zwei Teilen bestanden — einem Encoder und einem Decoder — und diese Variante den Encoder vollständig weglässt.

Warum dieser Bauplan die KI-Branche dominiert

Das Weglassen des Encoders klingt nach einem Verlust. In der Praxis hat es sich als Stärke erwiesen. Ein Decoder-only-Modell kann mit einer einzigen Architektur überraschend viele Aufgaben erledigen: übersetzen, zusammenfassen, Code schreiben, Fragen beantworten. Man muss es nicht für jede Aufgabe neu bauen.

Der zweite Grund ist das Training. Decoder-only-Modelle lernen nach einem besonders einfachen Prinzip: Sie sehen einen Textanfang und müssen das nächste Wort vorhersagen. Das ist simpel zu formulieren, aber enormen Mengen an Text ausgesetzt, entstehen dadurch Modelle mit breitem Wissen. Dieses Trainingsverfahren heißt auch „autoregressive Vorhersage“ — auto, weil das Modell immer seine eigenen vorherigen Ausgaben als Eingabe verwendet.

Ein Encoder-Decoder-Modell wie das ältere Google Translate war für Übersetzung gebaut und dort exzellent. Decoder-only-Modelle sind dafür etwas weniger spezialisiert, aber universell einsetzbar. In einer Branche, die auf einen einzigen Alleskönner setzt statt auf viele Spezialisten, hat sich das als entscheidender Vorteil herausgestellt.

Wie ein Decoder-only-Modell Text erzeugt

Das Modell bekommt einen Starttext, die sogenannte Eingabe oder „Prompt“. Dann berechnet es, welches Wort als nächstes am wahrscheinlichsten passt — und hängt es an. Dann berechnet es das übernächste Wort, diesmal auf Basis des längeren Textes. Dieser Vorgang wiederholt sich, bis ein Satzzeichen oder ein festgelegtes Limit das Modell stoppt.

Damit das Modell dabei den Zusammenhang des gesamten bisherigen Textes im Blick behalten kann, nutzt es einen Mechanismus namens Attention (auf Deutsch: Aufmerksamkeit). Er erlaubt dem Modell, beim Erzeugen jedes neuen Wortes auf alle vorherigen Wörter zu „achten“ — also Bezüge herzustellen, auch wenn zwei zusammengehörende Wörter weit auseinanderliegen. Entscheidend ist jedoch die Einschränkung: Das Modell sieht ausschließlich rückwärts. Zukünftige Wörter sind beim Erzeugen noch nicht vorhanden und bleiben damit unsichtbar. Diese Einschränkung heißt „Causal Masking“ und ist das, was einen Decoder von einem Encoder unterscheidet.

Wie viel Text das Modell gleichzeitig im Blick behalten kann, nennt man den Kontext oder das „Kontextfenster“. Ein kurzes Fenster bedeutet, das Modell vergisst frühere Teile eines langen Gesprächs. Moderne Decoder-only-Modelle haben Kontextfenster von hunderttausenden Wörtern — ein technischer Fortschritt, der noch vor wenigen Jahren undenkbar war.

Decoder-only-Modelle in Produkten und Schlagzeilen

Wer ChatGPT, Microsoft Copilot oder den KI-Assistenten in einem Smartphone benutzt, verwendet fast immer ein Decoder-only-Modell. Auch im Hintergrund vieler Suchmaschinen und Programmierhilfen wie GitHub Copilot arbeitet dieser Bauplan. Die GPT-Reihe von OpenAI hat den Begriff bekannt gemacht — das „G“ in GPT steht für „Generative“, das „P“ für „Pre-trained“, das „T“ für „Transformer“, die zugrunde liegende Rechentechnik.

In Tech-News taucht der Begriff oft im Vergleich auf. Dort werden Decoder-only-Modelle manchmal abgegrenzt von sogenannten Encoder-only-Modellen wie BERT, die keinen Text erzeugen, sondern Text verstehen und einordnen — etwa für Suchalgorithmen oder Spamfilter. Die Grenze zwischen beiden Welten verschwimmt zunehmend, weil neuere Modelle versuchen, Stärken aus beiden Lagern zu verbinden.

Ein häufiger Irrtum in der Berichterstattung: Größe und Bauplan werden oft durcheinandergebracht. Nicht jedes große Modell ist automatisch ein Decoder-only-Modell, und nicht jedes Decoder-only-Modell ist zwangsläufig groß. Es gibt leichtgewichtige Varianten, die auf einem Smartphone laufen, und es gibt Decoder-only-Modelle mit mehreren hundert Milliarden Parametern — die Maßeinheit für die Anzahl der lernbaren Stellen im Modell —, die ganze Rechenzentren füllen.

Produkte dazu

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.