Gegenüberstellung zweier Bauweisen: links ein Transformer, bei dem Pfeile jedes Wort mit jedem anderen Wort verbinden; rechts ein State-Space-Block, bei dem die Wörter in einer Kette durchlaufen werden und ein gleich großer Zustandsspeicher von Wort zu Wort weitergereicht und aktualisiert wird.

State-Space-Blöcke

State-Space-Blöcke sind Bausteine von KI-Modellen, die einen Text Wort für Wort durchgehen und dabei eine Art Gedächtnis mitführen, statt jedes Mal den ganzen Text neu zu überblicken. Sie gelten als sparsame Alternative zu der Bauweise, auf der die meisten heutigen Sprachmodelle beruhen.

Ein Sprachmodell ist ein Computerprogramm, das gelernt hat, Texte fortzusetzen. Solche Modelle bestehen aus vielen gleichartigen Bausteinen, die hintereinandergeschaltet sind. State-Space-Blöcke sind eine bestimmte Bauart dieser Bausteine. Ihr Kennzeichen: Sie lesen einen Text von vorne nach hinten durch und merken sich das Wichtige in einem kleinen internen Speicher. Dieser Speicher heißt Zustand, englisch state, und daher kommt der Name. Bei jedem neuen Wort wird der Zustand aktualisiert, das alte Wort selbst aber nicht mehr angeschaut.

Die Idee stammt ursprünglich aus der Regelungstechnik, also aus dem Bau von Steuerungen für Maschinen. Dort beschreibt man ein System durch seinen aktuellen Zustand und eine Regel, wie er sich verändert. Seit etwa 2021 wird dieses Prinzip für KI-Modelle benutzt. Bekannte Vertreter heißen S4 und Mamba.

Der Preis der langen Texte

Fast alle heutigen Sprachmodelle nutzen eine andere Bauart, den sogenannten Transformer. Dessen zentraler Mechanismus vergleicht jedes Wort mit jedem anderen Wort im Text. Das ist sehr leistungsfähig, wird aber schnell teuer. Verdoppelt man die Textlänge, vervierfacht sich der Rechenaufwand. Bei sehr langen Eingaben wird das zum Problem.

State-Space-Blöcke wachsen anders. Sie verarbeiten jedes Wort einmal und aktualisieren dabei ihren Zustand. Doppelt so viel Text bedeutet also ungefähr doppelt so viel Arbeit, nicht das Vierfache. Der Speicherbedarf bleibt sogar fast konstant, weil der Zustand immer gleich groß ist. Genau deshalb interessieren sich Forschung und Industrie für diese Blöcke.

Praktisch relevant wird das bei Aufgaben mit sehr langen Eingaben. Ein ganzes Buch, eine Stunde Audio oder ein Genomabschnitt kann leicht Hunderttausende Einheiten umfassen. Für Transformer ist das teuer, für State-Space-Modelle gut machbar. Dafür sind Transformer bislang besser darin, ein einzelnes Detail aus der Mitte eines langen Textes exakt wiederzufinden.

Zustand, Filter und die Rolle des Trainings

Man kann sich den Zustand als Notizzettel vorstellen, der eine feste Größe hat. Beim Lesen jedes neuen Wortes schreibt das Modell etwas dazu und löscht dafür anderes. Wie stark Altes verblasst und wie stark Neues gewichtet wird, steht in Zahlenwerten, die im Training gelernt wurden. Niemand legt von Hand fest, was sich das Modell merken soll.

Diese Rechenvorschrift ist im Kern eine einfache Formel, die immer wieder angewendet wird. Das klingt langsam, weil ein Wort auf das vorherige warten muss. Beim Training gibt es aber einen mathematischen Trick: Die gesamte Abfolge lässt sich in eine Form umschreiben, die Grafikkarten parallel abarbeiten können. Erst dadurch wurden State-Space-Blöcke überhaupt praktisch nutzbar.

Ein wichtiger Fortschritt kam 2023 mit Mamba. Dort hängen die Zahlenwerte für Merken und Vergessen vom aktuellen Wort ab. Das Modell kann also unwichtige Füllwörter überspringen und bei wichtigen Stellen genauer hinsehen. Ältere Varianten behandelten jedes Wort nach derselben starren Regel.

Mamba, Hybride und was in den News steht

Direkt sichtbar sind State-Space-Blöcke für Nutzer nicht. Sie stecken im Inneren von Modellen, ähnlich wie der Motortyp im Inneren eines Autos. Wer aber Meldungen über neue KI-Modelle liest, stößt regelmäßig auf Namen wie Mamba, Jamba oder Falcon Mamba. Auch Nvidia und mehrere Forschungslabore haben Modelle mit solchen Blöcken veröffentlicht.

In der Praxis setzen viele Entwickler auf Mischformen. Ein Modell enthält dann überwiegend State-Space-Blöcke und dazwischen einige Transformer-Schichten. Die einen sorgen für Tempo bei langen Texten, die anderen für präzises Nachschlagen einzelner Stellen. Solche Hybride gelten derzeit als der aussichtsreichste Weg.

Ein verbreiteter Irrtum ist, State-Space-Blöcke würden Transformer bald ablösen. Bisher deutet wenig darauf hin. Interessant sind sie vor allem dort, wo Rechenzeit und Stromverbrauch zählen, etwa auf Handys oder in Rechenzentren mit vielen Anfragen. Ob sie sich breit durchsetzen, hängt daran, ob sie bei gleicher Größe ähnlich gute Antworten liefern.

Produkte dazu

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.