
Data Lineage
Data Lineage bezeichnet die lückenlose Nachverfolgung, woher ein Datensatz stammt, welche Stationen er durchlaufen hat und wie er dabei verändert wurde. Unternehmen und KI-Entwickler nutzen es, um Fehler in Daten aufzuspüren und gesetzliche Nachweispflichten zu erfüllen.
Stell dir vor, du bekommst eine Tabelle mit Verkaufszahlen — aber niemand weiß mehr, woher die Daten kommen oder ob jemand sie zwischendurch bearbeitet hat. Data Lineage löst genau dieses Problem. Es ist die vollständige Aufzeichnung des Lebenswegs eines Datensatzes: Wo wurde er erzeugt? Welche Systeme hat er durchlaufen? Wer hat ihn wann verändert? Das Ergebnis ist eine Art Stammbaum für Daten, der jeden Schritt dokumentiert — vom ersten Eintrag bis zur endgültigen Auswertung.
Warum fehlerhafte Daten so gefährlich sind
Daten wandern in modernen Unternehmen durch viele Hände und Systeme. Eine Kundendatenbank speist Berichte, die Berichte fließen in KI-Modelle, die KI-Modelle beeinflussen Entscheidungen. Schleicht sich an irgendeiner Stelle ein Fehler ein, pflanzt er sich durch die gesamte Kette fort.
Ohne Data Lineage ist es wie die Suche nach einem Druckfehler ohne zu wissen, in welcher Druckerei das Buch hergestellt wurde. Mit Data Lineage sieht man auf einen Blick: In Schritt drei wurde die Umsatzspalte durch eine fehlerhafte Umrechnung überschrieben. Das spart Stunden an Fehlersuche und verhindert, dass falsche Zahlen in wichtige Entscheidungen einfließen.
Für KI-Modelle ist das besonders kritisch. Ein Modell ist nur so gut wie die Daten, mit denen es trainiert wurde. Wenn Trainingsdaten unklarer Herkunft sind, lässt sich hinterher nicht prüfen, ob sie verzerrt oder fehlerhaft waren. Data Lineage macht diesen Nachweis möglich.
Wie der Stammbaum eines Datensatzes entsteht
Die Grundidee ist einfach: Jedes Mal, wenn ein Datensatz erzeugt, kopiert, gefiltert oder zusammengeführt wird, hinterlässt das System einen Eintrag. Dieser Eintrag enthält mindestens drei Dinge — was passiert ist, wann es passiert ist und welches System oder welche Person verantwortlich war. Zusammengesetzt ergeben diese Einträge eine gerichtete Kette, die man rückwärts lesen kann wie einen Kontoauszug.
In der Praxis gibt es zwei Varianten. Bei der manuellen Erfassung pflegen Teams diese Informationen selbst in Dokumenten. Das ist aufwendig und fehleranfällig. Bei der automatischen Erfassung überwachen spezialisierte Werkzeuge — sogenannte Lineage-Tools — die Datenbewegungen direkt in den Systemen und schreiben das Protokoll ohne menschliches Zutun. Große Plattformen wie Apache Atlas oder Cloud-Dienste von Microsoft und Google bieten solche Funktionen eingebaut an.
Ein wichtiger Unterschied besteht zwischen der groben und der feinen Ebene. Auf der groben Ebene sieht man, dass Datei A in System B geflossen ist. Auf der feinen Ebene sieht man, dass Spalte drei aus Datei A mit Spalte sieben aus Datei C zusammengeführt wurde und dabei der niedrigere Wert gewählt wurde. Je feiner die Dokumentation, desto nützlicher — aber auch desto aufwendiger.
Data Lineage in Regulierung und KI-Entwicklung
Banken und Versicherungen sind in Europa gesetzlich verpflichtet, nachzuweisen, wie ihre Risikokennzahlen zustande kommen. Die europäische Bankenaufsicht schreibt das unter dem Kürzel BCBS 239 fest. Ohne Data Lineage können Firmen diese Nachweise schlicht nicht erbringen — und riskieren empfindliche Strafen.
Der EU AI Act, der seit 2024 schrittweise in Kraft tritt, geht einen Schritt weiter. Für sogenannte Hochrisiko-KI-Systeme — etwa in der Kreditvergabe oder in der Personalauswahl — müssen Unternehmen dokumentieren, mit welchen Daten ihr Modell trainiert wurde. Data Lineage ist damit kein optionales Qualitätsmerkmal mehr, sondern eine rechtliche Anforderung.
Auch in der Berichterstattung taucht der Begriff regelmäßig auf, wenn Unternehmen erklären müssen, warum ein KI-System eine fehlerhafte oder diskriminierende Entscheidung getroffen hat. Meist zeigt sich dann: Die Herkunft der Trainingsdaten war nicht sauber dokumentiert. Data Lineage soll genau das verhindern.