Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Datenbereinigung

Data Cleaning / Data Cleansing · Maximilian Fuchs · 24. April 2026 · 5 Min. Lesezeit

Was versteht man unter Datenbereinigung?

Datenbereinigung bezeichnet den Prozess, einen Rohdatensatz so aufzubereiten, dass er für statistische Analysen geeignet ist. Konkret umfasst das die Identifikation und Behandlung von Problemen, die die Qualität der Daten beeinträchtigen. Typische Aufgaben sind:

  • Fehlende Werte (Missing Values): Datenpunkte, die nicht erhoben wurden oder verloren gegangen sind, müssen identifiziert und entweder entfernt, ersetzt oder imputiert werden.
  • Ausreißer (Outliers): Extreme Werte, die möglicherweise auf Mess- oder Eingabefehler hinweisen, werden geprüft und ggf. korrigiert oder ausgeschlossen.
  • Duplikate: Doppelt vorhandene Einträge, etwa durch fehlerhafte Datenbankabfragen, werden entfernt.
  • Inkonsistente Formatierung: Unterschiedliche Schreibweisen desselben Wertes (z. B. „männlich“, „m“, „M“) werden vereinheitlicht.
  • Falsche Datentypen: Zahlen, die fälschlich als Text gespeichert sind, oder umgekehrt, werden korrigiert.
Einfach erklärt Stell dir vor, du bekommst einen Stapel handausgefüllter Fragebögen. Manche Felder sind leer, manche unleserlich, manche Angaben wirken unrealistisch hoch. Bevor du die Antworten auswerten kannst, musst du diesen Stapel erst „durcharbeiten“ und in Ordnung bringen – genau das ist Datenbereinigung.

Warum ist Datenbereinigung für statistische Analysen wichtig?

Die Qualität einer statistischen Analyse hängt direkt von der Qualität der zugrunde liegenden Daten ab. In der Forschungspraxis gilt der Grundsatz: Garbage in, garbage out – wer fehlerhafte Daten analysiert, erhält fehlerhafte Ergebnisse, egal wie ausgefeilte Methoden eingesetzt werden.

Fehlende Werte können die Stichprobengröße reduzieren und, wenn sie nicht zufällig fehlen, systematische Verzerrungen (Bias) erzeugen. Ausreißer können Mittelwerte, Standardabweichungen und Korrelationen erheblich verzerren. Inkonsistente Kategorien führen dazu, dass Gruppen nicht korrekt verglichen werden können.

Datenbereinigung ist außerdem keine einmalige Aufgabe, sondern ein iterativer Prozess: Erst beim tieferen Einblick in die Daten – etwa durch deskriptive Statistiken oder Visualisierungen – werden viele Probleme sichtbar.

Häufiger Fehler Ausreißer werden vorschnell gelöscht, ohne zu prüfen, ob sie echte (inhaltlich bedeutsame) extreme Werte oder tatsächliche Messfehler sind. Das Entfernen valider Extremwerte verzerrt die Ergebnisse genauso wie das Belassen von Fehlern. Dokumentiere deshalb immer transparent, welche Bereinigungsschritte du vorgenommen hast und warum.
Gut zu wissen In vielen Studien entfällt ein erheblicher Teil der Arbeitszeit auf die Datenbereinigung – Schätzungen zufolge bis zu 60–80 % der gesamten Analysezeit. Wer diesen Schritt sorgfältig dokumentiert, macht seine Forschung nachvollziehbarer und reproduzierbarer.

Praxisbeispiel zu Datenbereinigung

Eine Studierende wertet im Rahmen ihrer Bachelorarbeit eine Online-Umfrage zum Schlafverhalten von 200 Studierenden aus. Nach dem Export der Rohdaten stellt sie folgende Probleme fest:

Tabelle 1. Typische Datenfehler und mögliche Lösungsansätze
Problem Beispiel Lösungsansatz
Fehlender Wert Schlafstunden: leer Imputation mit dem Median der Gruppe oder Ausschluss bei listwise deletion
Unrealistischer Ausreißer Schlafstunden pro Nacht: 25 Als Eingabefehler werten und ausschließen, Entscheidung dokumentieren
Inkonsistente Kategorie Studiengang: „Psychologie“, „psychologie“, „PSY“ Vereinheitlichung auf einen Standardwert
Duplikat Teilnehmer-ID 047 zweimal vorhanden Einen Eintrag entfernen, ggf. inhaltlich prüfen

Nachdem die Studierende diese Schritte durchgeführt und in einem Bereinigungsprotokoll festgehalten hat, reduziert sich der Datensatz von 200 auf 187 verwendbare Fälle. Diese saubere Datenbasis ist die Grundlage für alle weiteren Analysen – von deskriptiven Statistiken bis hin zur Regressionsanalyse.

Datenbereinigung Fehlende Werte Ausreißer Datenqualität Deskriptive Statistik Imputation Rohdaten Forschungsmethoden

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!