Attention
Attention ist ein Rechenverfahren, mit dem ein KI-Programm für jedes Wort in einem Text entscheidet, welche anderen Wörter dafür wichtig sind. Sie ist der Kern moderner Sprachmodelle wie ChatGPT und der Grund, warum diese Programme längere Zusammenhänge verstehen.

Wenn ein Computerprogramm einen Satz verarbeitet, muss es jedes Wort im Zusammenhang deuten. Im Satz „Der Hund jagt die Katze, weil sie schnell ist“ ist unklar, wer mit „sie“ gemeint ist. Ein Mensch löst das, indem er auf die passenden Wörter im Satz zurückblickt. Attention ist genau dieses Zurückblicken, in Rechenschritte übersetzt. Das Programm berechnet für jedes Wort, wie stark jedes andere Wort dazu beiträgt. Wörter mit hohem Wert fließen stark in die Deutung ein, unwichtige fast gar nicht. Der englische Begriff bedeutet „Aufmerksamkeit“, und im Deutschen spricht man auch vom Aufmerksamkeitsmechanismus.
Warum Sprachmodelle ohne Attention nicht funktionieren
Vor 2017 verarbeiteten Sprachprogramme Texte streng von links nach rechts, Wort für Wort. Sie führten dabei eine Art Gedächtnisnotiz mit, die nach jedem Wort überschrieben wurde. Bei langen Texten ging der Anfang darin verloren. Ein Bezug über zwanzig Wörter hinweg war kaum zu halten.
Attention löst dieses Problem, weil jedes Wort direkt auf jedes andere zugreifen darf. Es gibt keinen Umweg über ein schrumpfendes Gedächtnis. Ein Verweis am Ende eines Absatzes erreicht das erste Wort in einem einzigen Rechenschritt. Deshalb können heutige Modelle ganze Buchkapitel im Blick behalten.
Der zweite Vorteil ist praktischer Natur. Alle Wörter lassen sich gleichzeitig berechnen, statt eines nach dem anderen. Genau das macht Grafikkarten so gut, und genau deshalb wurde das Training riesiger Modelle überhaupt bezahlbar. Die Fachwelt datiert den Beginn des heutigen KI-Booms auf den Aufsatz „Attention Is All You Need“, in dem dieses Verfahren vorgestellt wurde.
Wie die Gewichtung eines Wortes berechnet wird
Jedes Wort wird im Modell als lange Zahlenliste dargestellt. Aus dieser Liste erzeugt das Modell drei neue Listen mit unterschiedlicher Aufgabe. Die erste beschreibt, wonach das Wort sucht. Die zweite beschreibt, was das Wort selbst anzubieten hat. Die dritte enthält den Inhalt, der später weitergegeben wird. In der Fachsprache heißen sie Query, Key und Value.
Man kann sich das wie eine Suche in einer Bibliothek vorstellen. Die Suchanfrage wird mit den Aufschriften aller Bücher verglichen. Je besser Anfrage und Aufschrift zusammenpassen, desto höher der Punktwert. Diese Punktwerte werden anschließend so umgerechnet, dass sie zusammen 100 Prozent ergeben. Das Ergebnis ist eine Mischung der Inhalte, in der passende Wörter dominieren.
Moderne Modelle machen das nicht einmal, sondern parallel in mehreren getrennten Durchgängen. Diese Durchgänge heißen Heads, also Köpfe. Ein Kopf achtet vielleicht auf grammatische Bezüge, ein anderer auf inhaltliche Ähnlichkeit. Niemand legt das von Hand fest, es entsteht beim Lernen. Ein Nachteil bleibt: der Rechenaufwand wächst quadratisch mit der Textlänge. Doppelt so viel Text bedeutet viermal so viel Arbeit.
Attention in Chatbots, Bildgeneratoren und Börsenmeldungen
Jeder Chatbot, den man heute benutzt, rechnet bei jedem Wort Attention. Auch Übersetzungsdienste, automatische Untertitel und Programmierhilfen beruhen darauf. Bildgeneratoren nutzen sie, um Textbeschreibung und Bildbereiche zu verknüpfen. Selbst Programme zur Vorhersage von Proteinstrukturen verwenden dasselbe Prinzip.
In Nachrichten begegnet der Begriff meist indirekt. Wenn eine Firma ein Modell mit „einer Million Token Kontext“ bewirbt, geht es darum, über wie viel Text Attention noch bezahlbar bleibt. Meldungen über neue Verfahren wie Flash Attention oder Sparse Attention betreffen genau diesen Kostenpunkt. Sie sparen Speicher oder lassen Wörter bewusst weg, die vermutlich unwichtig sind.
Ein häufiger Irrtum ist, Attention sei eine Art Verstehen oder gar Bewusstsein. Sie ist reine Rechnerei mit Zahlen und Gewichten. Verwechseln sollte man sie auch nicht mit dem Transformer, dem Gesamtbauplan solcher Modelle. Attention ist dessen wichtigstes Bauteil, aber eben nur ein Bauteil unter mehreren.