Schematische Darstellung einer LSTM-Zelle mit den drei Toren (Vergessenstor, Eingangstor, Ausgangstor) und dem Zellzustand als separatem horizontalem Kanal, der von links nach rechts durch mehrere Zeitschritte verläuft.

LSTM

Ein LSTM ist eine Art künstliches neuronales Netz, das speziell dafür gebaut wurde, sich über lange Sequenzen hinweg an wichtige Informationen zu erinnern. Es war jahrelang die Standardlösung für Aufgaben wie Sprachübersetzung oder Spracherkennung, bevor Transformer-Modelle es ablösten.

Ein LSTM — ausgeschrieben Long Short-Term Memory, auf Deutsch etwa „langes Kurzzeitgedächtnis“ — ist ein Bauplan für ein künstliches neuronales Netz, also ein Rechensystem, das grob dem Aufbau des menschlichen Gehirns nachempfunden ist. Es wurde 1997 von den Forschern Sepp Hochreiter und Jürgen Schmidhuber entwickelt. Der besondere Zweck eines LSTMs ist das Verarbeiten von Sequenzen — also Daten, bei denen die Reihenfolge zählt, zum Beispiel Sätze, Zeitreihen oder Melodien. Ein gewöhnliches Netz verarbeitet jede Eingabe unabhängig von der vorherigen. Ein LSTM dagegen führt einen internen Zustand mit, der Informationen aus früheren Schritten speichert und in spätere weitergibt.

Warum das „Vergessen-Problem“ LSTMs notwendig machte

Vor dem LSTM gab es bereits sogenannte rekurrente neuronale Netze, kurz RNNs. Diese Netze leiten bei jedem Schritt Informationen an den nächsten Schritt weiter. Das klingt gut, hat aber einen entscheidenden Haken: Je länger die Sequenz wird, desto mehr verblasst die frühe Information. Das Netz „vergisst“, was am Anfang stand. Dieses Problem nennt man auf Englisch Vanishing Gradient Problem.

Stell dir vor, du liest einen langen Aufsatz und sollst am Ende eine Frage beantworten, deren Antwort im ersten Satz stand. Ein klassisches RNN würde diesen ersten Satz kaum noch berücksichtigen. Für Aufgaben wie Übersetzung oder Textverstehen ist das fatal, weil ein Wort am Satzende oft vom Satzanfang abhängt. Genau dieses Problem hat das LSTM gelöst — und damit eine ganze Klasse von KI-Anwendungen erst möglich gemacht.

Tore statt Durchlaufbetrieb: der Mechanismus im LSTM

Das Herzstück eines LSTMs sind drei sogenannte Tore: das Vergessenstor, das Eingangstor und das Ausgangstor. Jedes Tor ist ein kleines Rechenwerk, das entscheidet, wie viel einer Information durchgelassen wird. Das Vergessenstor legt fest, welche alten Erinnerungen gelöscht werden. Das Eingangstor entscheidet, welche neuen Informationen hinzukommen. Das Ausgangstor bestimmt, was an den nächsten Schritt weitergegeben wird.

Zusätzlich zu diesen Toren pflegt das LSTM einen sogenannten Zellzustand — eine Art separaten Speicherkanal, der quer durch die ganze Sequenz läuft. Dieser Kanal verändert sich nur dort, wo die Tore es erlauben, und bleibt sonst stabil. Das verhindert das Verblassen der frühen Information. Alle diese Gewichte — also die Zahlen, die steuern, wie die Tore reagieren — lernt das Netz automatisch während des Trainings aus Beispieldaten.

Wichtig ist eine Abgrenzung: Ein LSTM verarbeitet eine Sequenz schrittweise, einen Eintrag nach dem anderen. Es kann also nicht alle Teile einer Sequenz gleichzeitig betrachten. Genau das können spätere Transformer-Modelle, was sie bei sehr langen Texten leistungsfähiger macht.

LSTMs in Produkten und in den News

LSTMs waren bis etwa 2018 in fast jedem Sprachprodukt verbaut. Google Translate nutzte sie, bevor das System auf Transformer-Architektur umgestellt wurde. Siri und Alexa verwendeten LSTM-basierte Komponenten für die Spracherkennung. Auch in der Musikgenerierung — etwa Googles Projekt Magenta — kamen LSTMs früh zum Einsatz, weil Musik eine zeitliche Struktur hat, die ein LSTM gut abbilden kann.

Heute taucht der Begriff vor allem im Vergleich mit Transformern auf. Medienberichte, die den Aufstieg von GPT oder anderen großen Sprachmodellen erklären, erwähnen LSTMs oft als Vorgänger. In spezialisierten Bereichen wie der Analyse von Finanzzeitreihen oder medizinischen Signaldaten — zum Beispiel EKG-Auswertungen — sind LSTMs aber nach wie vor im Einsatz. Der Grund: Für kurze, strukturierte Sequenzen sind sie oft schneller trainierbar und ressourcenschonender als ein großes Transformer-Modell.

Wer also Schlagzeilen über KI-Modelle liest und versteht, was ein LSTM ist, versteht auch besser, warum die KI-Forschung nicht stehengeblieben ist — und welches konkrete Problem der Transformer gelöst hat, das das LSTM noch hatte.

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.