
Langzeitkohärenz
Langzeitkohärenz beschreibt die Fähigkeit eines KI-Systems, über sehr lange Texte, Gespräche oder Arbeitsabläufe hinweg widerspruchsfrei zu bleiben. Sie gilt als eine der größten offenen Schwächen heutiger Sprachmodelle.
Programme wie ChatGPT erzeugen Text, indem sie immer wieder das nächste Wort vorhersagen. Über wenige Sätze klappt das erstaunlich gut. Über hunderte Seiten oder über ein Gespräch, das sich über Wochen zieht, wird es schwierig. Dann widerspricht sich das Programm: Eine Figur heißt plötzlich anders, eine früher genannte Zahl stimmt nicht mehr, eine getroffene Entscheidung wird stillschweigend umgestoßen. Langzeitkohärenz ist der Fachbegriff für die Fähigkeit, genau das zu vermeiden. Gemeint ist also die Frage, ob ein System über lange Strecken bei einer Linie bleibt, statt in jedem Abschnitt neu anzufangen.
Der Unterschied zwischen einer guten Seite und einem guten Buch
Kurze Texte kann heutige KI oft auf sehr hohem Niveau schreiben. Eine E-Mail, eine Zusammenfassung, ein Stück Programmcode: das gelingt regelmäßig überzeugend. Sobald die Aufgabe größer wird, bricht die Qualität aber ein. Ein Roman braucht eine Handlung, die nach 300 Seiten noch trägt. Eine Software braucht Bausteine, die auch im zwanzigsten Arbeitsschritt noch zusammenpassen.
Wirtschaftlich ist dieser Punkt entscheidend. Viele wertvolle Aufgaben sind nämlich lange Aufgaben. Ein Steuerprüfung, ein Forschungsprojekt, die Betreuung eines Kunden über Monate: All das besteht aus vielen Schritten, die aufeinander aufbauen. Ein System, das nur einzelne Schritte beherrscht, braucht ständig einen Menschen als Aufpasser. Erst mit verlässlicher Langzeitkohärenz könnte es ganze Vorgänge übernehmen.
Deshalb messen Fachleute inzwischen weniger die reine Antwortqualität. Stattdessen fragen sie: Wie lange kann ein System eigenständig arbeiten, bevor es entgleist? Diese Zeitspanne hat sich in den letzten Jahren spürbar verlängert, von Minuten in Richtung mehrerer Stunden. Sie ist aber immer noch der Flaschenhals.
Warum Modelle den Faden verlieren
Ein Sprachmodell hat kein Gedächtnis im menschlichen Sinn. Es sieht bei jeder Antwort nur das, was gerade in seinem Arbeitsspeicher steht. Dieser Bereich heißt Kontextfenster und fasst eine begrenzte Menge Text. Ist er voll, fällt Älteres heraus oder wird stark verkürzt. Was herausfällt, existiert für das Modell schlicht nicht mehr.
Größere Kontextfenster lösen das Problem nur teilweise. Manche Modelle verarbeiten heute eine Million Wörter auf einmal. Trotzdem sinkt die Trefferquote, je weiter Informationen auseinander liegen. Fachleute sprechen vom Verlust in der Mitte: Am Anfang und am Ende des Textes findet das Modell Details zuverlässig, dazwischen übersieht es sie häufiger.
Dazu kommt ein zweiter Effekt. Jeder kleine Fehler bleibt im Text stehen und dient als Grundlage für die nächsten Sätze. Fehler summieren sich also, statt sich auszugleichen. Ein häufiger Irrtum ist deshalb, Langzeitkohärenz für ein reines Speicherproblem zu halten. Sie ist auch ein Planungsproblem: Das Modell müsste erkennen, dass es gerade von seinem eigenen Plan abweicht.
Gegenmittel: Notizen, Zusammenfassungen, Zwischenprüfungen
Entwickler geben Systemen deshalb ein externes Gedächtnis. Wichtige Fakten werden in einer Datenbank abgelegt und bei Bedarf zurück in den Arbeitsspeicher geholt. Andere Ansätze fassen lange Gespräche regelmäßig zusammen und tragen nur die Zusammenfassung weiter. In Programmierwerkzeugen sieht man das an Dateien, in denen das System seine eigenen Regeln und Zwischenstände notiert.
Im Alltag begegnet einem der Begriff meist indirekt. Wenn ein Chatbot nach zwanzig Minuten vergisst, wie man heißt, ist das ein Kohärenzproblem. Wenn ein KI-Video die Gesichtszüge einer Person von Sekunde zu Sekunde verändert, ebenfalls. In Produktankündigungen tauchen dafür Schlagworte wie Memory, Projects oder Agent auf.
In den Nachrichten lohnt sich daher eine skeptische Frage. Wenn ein Unternehmen von KI-Mitarbeitern spricht, sollte man wissen wollen, wie lange diese ohne Korrektur durchhalten. Genau daran entscheidet sich, ob ein Werkzeug nur beeindruckende Einzelantworten liefert oder wirklich ganze Aufgaben erledigt.