Datenbereinigung
In diesem Beitrag
Was versteht man unter Datenbereinigung?
Datenbereinigung bezeichnet den Prozess, einen Rohdatensatz so aufzubereiten, dass er für statistische Analysen geeignet ist. Konkret umfasst das die Identifikation und Behandlung von Problemen, die die Qualität der Daten beeinträchtigen. Typische Aufgaben sind:
- Fehlende Werte (Missing Values): Datenpunkte, die nicht erhoben wurden oder verloren gegangen sind, müssen identifiziert und entweder entfernt, ersetzt oder imputiert werden.
- Ausreißer (Outliers): Extreme Werte, die möglicherweise auf Mess- oder Eingabefehler hinweisen, werden geprüft und ggf. korrigiert oder ausgeschlossen.
- Duplikate: Doppelt vorhandene Einträge, etwa durch fehlerhafte Datenbankabfragen, werden entfernt.
- Inkonsistente Formatierung: Unterschiedliche Schreibweisen desselben Wertes (z. B. „männlich“, „m“, „M“) werden vereinheitlicht.
- Falsche Datentypen: Zahlen, die fälschlich als Text gespeichert sind, oder umgekehrt, werden korrigiert.
Warum ist Datenbereinigung für statistische Analysen wichtig?
Die Qualität einer statistischen Analyse hängt direkt von der Qualität der zugrunde liegenden Daten ab. In der Forschungspraxis gilt der Grundsatz: Garbage in, garbage out – wer fehlerhafte Daten analysiert, erhält fehlerhafte Ergebnisse, egal wie ausgefeilte Methoden eingesetzt werden.
Fehlende Werte können die Stichprobengröße reduzieren und, wenn sie nicht zufällig fehlen, systematische Verzerrungen (Bias) erzeugen. Ausreißer können Mittelwerte, Standardabweichungen und Korrelationen erheblich verzerren. Inkonsistente Kategorien führen dazu, dass Gruppen nicht korrekt verglichen werden können.
Datenbereinigung ist außerdem keine einmalige Aufgabe, sondern ein iterativer Prozess: Erst beim tieferen Einblick in die Daten – etwa durch deskriptive Statistiken oder Visualisierungen – werden viele Probleme sichtbar.
Praxisbeispiel zu Datenbereinigung
Eine Studierende wertet im Rahmen ihrer Bachelorarbeit eine Online-Umfrage zum Schlafverhalten von 200 Studierenden aus. Nach dem Export der Rohdaten stellt sie folgende Probleme fest:
| Problem | Beispiel | Lösungsansatz |
|---|---|---|
| Fehlender Wert | Schlafstunden: leer | Imputation mit dem Median der Gruppe oder Ausschluss bei listwise deletion |
| Unrealistischer Ausreißer | Schlafstunden pro Nacht: 25 | Als Eingabefehler werten und ausschließen, Entscheidung dokumentieren |
| Inkonsistente Kategorie | Studiengang: „Psychologie“, „psychologie“, „PSY“ | Vereinheitlichung auf einen Standardwert |
| Duplikat | Teilnehmer-ID 047 zweimal vorhanden | Einen Eintrag entfernen, ggf. inhaltlich prüfen |
Nachdem die Studierende diese Schritte durchgeführt und in einem Bereinigungsprotokoll festgehalten hat, reduziert sich der Datensatz von 200 auf 187 verwendbare Fälle. Diese saubere Datenbasis ist die Grundlage für alle weiteren Analysen – von deskriptiven Statistiken bis hin zur Regressionsanalyse.