Schematische Darstellung des Self-Attention-Mechanismus: Ein Beispielsatz mit fünf Wörtern, bei dem Pfeile von einem hervorgehobenen Wort zu allen anderen Wörtern führen; die Pfeilstärke repräsentiert das jeweilige Aufmerksamkeitsgewicht. Darunter drei parallele Spalten für Query, Key und Value mit Pfeilen, die zeigen, wie aus ihrer Kombination ein gewichtetes Ausgabewort entsteht.

Self-Attention-Mechanismus

Der Self-Attention-Mechanismus ist ein Verfahren, mit dem ein KI-Modell beim Verarbeiten eines Textes für jedes Wort berechnet, wie stark alle anderen Wörter im selben Satz damit zusammenhängen. Er bildet das Herzstück moderner Sprachmodelle wie GPT oder BERT.

Wenn ein Mensch den Satz „Die Bank am Fluss war morsch“ liest, weiß er sofort, dass „Bank“ hier ein Sitzmöbel meint und kein Geldinstitut — weil „Fluss“ und „morsch“ das klarstellen. Ein KI-Modell muss dasselbe leisten. Der Self-Attention-Mechanismus ist das Verfahren, das genau das ermöglicht. Er lässt das Modell für jedes Wort im Text nachschauen, welche anderen Wörter dabei helfen, seine Bedeutung zu verstehen. Das Ergebnis ist eine Art Gewichtungsliste: Wörter, die viel zur Bedeutung beitragen, bekommen ein hohes Gewicht, unwichtige ein niedriges. Dieses Verfahren läuft nicht nacheinander, Wort für Wort, sondern für alle Wörter gleichzeitig.

Warum Self-Attention Sprachmodelle erst möglich machte

Vor Self-Attention verarbeiteten Sprachmodelle Text streng von links nach rechts, Wort für Wort. Das war ein Problem: Wörter, die weit voneinander entfernt stehen, konnten nur schwer miteinander in Verbindung gebracht werden. In einem langen Satz „vergaß“ das Modell den Anfang, bis es das Ende erreichte.

Self-Attention löst das, weil jedes Wort direkt auf jedes andere zugreifen kann — egal, wie weit sie auseinanderliegen. Ein Wort am Satzende kann also problemlos mit dem ersten Wort des Satzes in Beziehung gesetzt werden. Das macht Modelle wie GPT oder BERT erst so leistungsfähig. 2017 stellten Forscher von Google in einem Aufsatz namens „Attention Is All You Need“ eine Architektur vor, die ausschließlich auf diesem Prinzip aufbaut: den Transformer. Seitdem ist Self-Attention der Standard in der Sprachverarbeitung.

Die Berechnung hinter der Aufmerksamkeit

Für jedes Wort erzeugt das Modell drei Zahlenlisten, die Query, Key und Value genannt werden. Query steht für die Frage, die ein Wort stellt: „Welche anderen Wörter sind für mich relevant?“ Key steht für die Antwort der anderen Wörter: „Das bin ich, schau ob ich passe.“ Value enthält die eigentliche Information, die ein Wort beisteuert, wenn es als passend erkannt wird.

Das Modell vergleicht die Query eines Wortes mit den Keys aller anderen Wörter — und zwar durch eine Multiplikation der Zahlenlisten. Je ähnlicher zwei Listen sind, desto höher fällt das Gewicht aus. Diese Gewichte werden dann genutzt, um die Values zu einem Gesamtergebnis zusammenzurechnen. Der ganze Vorgang wiederholt sich parallel in mehreren sogenannten Köpfen (Multi-Head Attention): Jeder Kopf lernt dabei, andere Arten von Beziehungen zu erkennen — zum Beispiel grammatikalische Abhängigkeiten in einem Kopf und inhaltliche Nähe in einem anderen.

Ein häufiger Irrtum ist, dass der Mechanismus „versteht“, was ein Wort bedeutet. Tatsächlich rechnet er nur mit Zahlen und optimiert diese Zahlen so, dass brauchbare Vorhersagen herauskommen. Bedeutung im menschlichen Sinne entsteht dabei nicht — aber das Ergebnis ist oft so überzeugend, dass es so wirkt.

Self-Attention in Produkten und Schlagzeilen

Jedes Mal, wenn jemand ChatGPT eine Frage stellt, läuft Self-Attention im Hintergrund. Dasselbe gilt für Google Translate, Copilot in Microsoft Word oder die automatische Vervollständigung beim Schreiben von E-Mails. Überall dort, wo ein Modell einen längeren Text verstehen oder erzeugen muss, ist Self-Attention im Einsatz.

In Tech-News taucht der Begriff vor allem auf, wenn über neue Modellarchitekturen berichtet wird. Viele Artikel über GPT-4, Gemini oder Llama erklären Verbesserungen damit, dass Self-Attention effizienter oder über längere Texte hinweg berechnet wurde. Die sogenannte „Kontextlänge“ — also wie viel Text ein Modell auf einmal verarbeiten kann — hängt direkt damit zusammen, über wie viele Wörter hinweg Self-Attention berechnet wird. Mehr Wörter bedeuten deutlich mehr Rechenaufwand, weil jedes Wort mit jedem anderen verglichen werden muss.

Auch außerhalb der Sprachverarbeitung wird Self-Attention eingesetzt. In Bildmodellen wie Stable Diffusion oder DALL-E hilft er dabei, Zusammenhänge zwischen verschiedenen Bildbereichen zu erkennen. Das Prinzip bleibt gleich — nur dass statt Wörtern kleine Bildausschnitte miteinander verglichen werden.

Produkte dazu

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.