Schema: Ein langer Text wird in Blöcke geteilt. Jeder Block wird zu einer kompakten Zusammenfassung verdichtet (Komprimierung). Aus diesen Zusammenfassungen wählt das Modell wenige besonders relevante Blöcke aus (Auswahl) und liest nur diese Wort für Wort. Beide Wege münden gemeinsam in die Antwortberechnung.

Compressed Sparse Attention

Compressed Sparse Attention ist ein Rechenverfahren in Sprachmodellen, das lange Texte teils zusammenfasst und teils gezielt auswählt, statt jedes Wort mit jedem anderen zu vergleichen. Dadurch können Programme wie Chatbots sehr lange Eingaben verarbeiten, ohne dass der Rechenaufwand explodiert.

Programme wie ChatGPT verarbeiten Text, indem sie prüfen, welche Wörter zueinander gehören. Bei diesem Vergleich schaut das Programm im Grundprinzip jedes Wort mit jedem anderen Wort zusammen an. Bei einem kurzen Satz ist das harmlos. Bei einem Text von 100.000 Wörtern werden daraus zehn Milliarden Vergleiche. Compressed Sparse Attention ist eine Abkürzung für diese Rechnerei. Sie fasst weit entfernte Textteile zu groben Zusammenfassungen zusammen und schaut nur bei wenigen, besonders wichtigen Stellen noch genau hin.

Warum lange Texte so teuer sind

Der Aufwand des klassischen Verfahrens wächst quadratisch. Verdoppelt man die Textlänge, vervierfacht sich die Rechenzeit. Verzehnfacht man sie, steigt der Aufwand um das Hundertfache. Genau deshalb hatten frühe Chatbots ein enges Gedächtnis von wenigen tausend Wörtern.

Heute wollen Nutzer aber ganze Bücher, Gesetzestexte oder Programmcode in einem Rutsch analysieren lassen. Ein Anbieter, der solche Anfragen bearbeitet, zahlt für jede einzelne davon Strom und Rechenzeit. Verfahren wie Compressed Sparse Attention senken diese Kosten oft um ein Vielfaches. Das entscheidet mit darüber, ob ein Dienst mit langen Eingaben überhaupt bezahlbar angeboten werden kann.

Ein zweiter Punkt ist die Geschwindigkeit. Niemand wartet gern zwei Minuten auf eine Antwort. Wer den Rechenaufwand drückt, bekommt die Antwort schneller zurück und kann mit derselben Hardware mehr Nutzer bedienen.

Zusammenfassen und gezielt hinschauen

Das Verfahren kombiniert zwei Ideen. Die erste ist die Komprimierung: Der Text wird in Blöcke von etwa 32 oder 64 Wörtern geteilt. Jeder Block wird zu einer einzigen kompakten Zusammenfassung verdichtet. Statt tausend einzelner Wörter muss das Modell dann nur noch wenige Dutzend Blockzusammenfassungen durchgehen.

Die zweite Idee ist die Auswahl, im Englischen sparse genannt. Zusammenfassungen verlieren Details, und manchmal kommt es genau auf ein Detail an. Deshalb bestimmt das Modell anhand der groben Blöcke, welche wenigen Blöcke gerade wirklich relevant sind. Nur diese werden noch einmal Wort für Wort ausgelesen, alle anderen bleiben in ihrer verdichteten Form.

Ein Vergleich hilft: Du suchst in einem Sachbuch eine Information. Du liest nicht alle 400 Seiten. Du überfliegst das Inhaltsverzeichnis, das ist die Komprimierung. Dann schlägst du drei Kapitel auf und liest dort genau, das ist die Auswahl. Wichtig ist, dass die Auswahlregeln nicht von Menschen festgelegt, sondern beim Training des Modells miterlernt werden.

Wo die Technik in Produkten steckt

Sichtbar wird das Verfahren an der Angabe zum Kontextfenster, also der maximalen Textmenge, die ein Modell auf einmal aufnehmen kann. Wenn ein Anbieter mit einer Million Token wirbt, stecken dahinter fast immer solche Sparsamkeitstricks. Ohne sie wäre eine derart lange Eingabe technisch kaum zu bezahlen.

Im Alltag begegnet dir das Ergebnis, wenn du eine PDF-Datei in einen Chatbot lädst, ein Programmierassistent ein ganzes Projekt überblickt oder ein Modell die Zusammenfassung eines langen Gesprächsverlaufs behält. In Fachnachrichten taucht der Begriff meist zusammen mit verwandten Verfahren auf, etwa Native Sparse Attention von DeepSeek oder Sliding Window Attention.

Ein verbreiteter Irrtum ist, das Modell werde dadurch klüger. Das ist nicht der Fall. Es wird schneller und billiger, und im ungünstigen Fall übersieht die Auswahl eine wichtige Stelle. Gute Umsetzungen erreichen bei den üblichen Tests fast dieselbe Qualität wie das vollständige Verfahren, bei einem Bruchteil des Aufwands.

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.