Explorative Datenanalyse

Explorative Datenanalyse

Explorative Datenanalyse (EDA) ist der erste Schritt im Umgang mit einem neuen Datensatz: Man untersucht die Daten ohne feste Hypothese, um Muster, Auffälligkeiten und Zusammenhänge zu entdecken, bevor man ein KI-Modell trainiert oder Schlussfolgerungen zieht.

Bevor man ein KI-Modell auf Daten loslässt, muss man verstehen, womit man es überhaupt zu tun hat. Explorative Datenanalyse — kurz EDA — ist genau dieser Schritt: Man schaut sich einen Datensatz systematisch an, ohne vorher festzulegen, was man finden will. Das klingt unstrukturiert, ist es aber nicht. Es geht darum, Fragen zu stellen: Fehlen Werte? Gibt es Ausreißer — also Messwerte, die weit außerhalb des normalen Bereichs liegen? Welche Spalten hängen miteinander zusammen? Erst wenn man das weiß, kann man sinnvoll weitermachen.

EDA als Absicherung gegen schlechte Modelle

Ein Modell, das auf schlechten Daten trainiert wird, liefert schlechte Ergebnisse — egal wie ausgefeilt der Algorithmus ist. In der Branche sagt man dazu: « Garbage in, garbage out ». EDA ist die wichtigste Gegenmaßnahme.

Fehler in Daten sind häufiger als man denkt. Temperatursensoren liefern manchmal negative Werte, wo keine stehen dürften. Kundendatensätze enthalten doppelte Einträge. Kategorien werden mal « männlich », mal « m » geschrieben. Wer diese Probleme erst bemerkt, wenn das Modell fertig ist, muss von vorne anfangen. Wer sie vorher findet, spart Zeit und verhindert stille Fehler — also Fehler, die das Modell unbemerkt verzerren.

EDA schützt außerdem vor einer falschen Fragestellung. Manchmal zeigt der erste Blick in die Daten, dass das eigentliche Problem ein anderes ist als gedacht. Vielleicht fehlt eine wichtige Spalte ganz. Vielleicht ist die Zielvariable — also das, was das Modell vorhersagen soll — kaum von anderen Merkmalen abhängig. Das früh zu wissen, ist wertvoller als jede Optimierung später.

Typische Schritte der Datenexploration

EDA beginnt meist mit einfachen Kennzahlen: Wie viele Zeilen und Spalten hat der Datensatz? Welche Werte kommen wie oft vor? Was sind Minimum, Maximum und Durchschnitt? Diese Übersicht dauert Sekunden, gibt aber sofort ein Gefühl für die Größe und Qualität der Daten.

Danach folgen Diagramme. Ein Histogramm zeigt, wie sich ein Merkmal verteilt — also ob die meisten Werte in einem engen Bereich liegen oder breit gestreut sind. Ein Streudiagramm zeigt, ob zwei Merkmale zusammenhängen. Eine Heatmap — eine farbcodierte Tabelle — macht auf einen Blick sichtbar, welche Spalten miteinander korrelieren, also gemeinsam steigen oder fallen. Diese Visualisierungen ersetzen kein Nachdenken, aber sie zeigen Muster, die in reinen Zahlen unsichtbar bleiben.

Ein typischer Irrtum ist, EDA mit Datenvorbereitung zu verwechseln. EDA bedeutet: verstehen. Fehler beheben, Werte umrechnen, Spalten zusammenführen — das ist ein separater Schritt, der auf EDA folgt, nicht Teil von ihr. Die Grenze ist fließend, aber die Unterscheidung hilft, den Überblick zu behalten.

EDA in der Praxis: von Jupyter-Notebooks bis zu AutoML

In der Praxis läuft EDA meist in sogenannten Notebooks — interaktiven Programmierumgebungen, in denen Code, Ergebnisse und Diagramme nebeneinander stehen. Das bekannteste Werkzeug dafür ist Jupyter Notebook, das in Wissenschaft und Industrie gleichermaßen verbreitet ist. Bibliotheken wie Pandas, Matplotlib oder Seaborn liefern die nötigen Funktionen in wenigen Zeilen Code.

Wer mit größeren Datensätzen arbeitet, greift zunehmend auf automatisierte EDA-Tools zurück. Programme wie ydata-profiling (früher pandas-profiling) erstellen mit einem einzigen Befehl einen vollständigen Bericht: Verteilungen, Korrelationen, fehlende Werte, Warnungen bei verdächtigen Mustern. Das ersetzt nicht das eigene Nachdenken, beschleunigt aber den ersten Überblick erheblich.

In News rund um KI-Projekte taucht EDA selten im Rampenlicht auf — sie passiert im Hintergrund, bevor ein Modell überhaupt gebaut wird. Trotzdem entscheidet sie oft darüber, ob ein Projekt gelingt. Viele gescheiterte KI-Pilotprojekte in Unternehmen lassen sich darauf zurückführen, dass die Daten nicht verstanden wurden, bevor man anfing zu modellieren.

Produkte dazu

Aktuelle News

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.