Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Missing-Data-Analyse

Missing Data Analysis · Fehlende-Werte-Analyse · Maximilian Fuchs · 24. April 2026 · 5 Min. Lesezeit

Was versteht man unter Missing-Data-Analyse?

Als Missing-Data-Analyse bezeichnet man die systematische Untersuchung fehlender Werte in einem Datensatz – also Beobachtungen, für die keine Messung vorliegt. Ziel ist es, das Muster und den Mechanismus der fehlenden Daten zu verstehen, bevor man entscheidet, wie man damit umgeht.

In der Statistik unterscheidet man drei grundlegende Fehlend-Mechanismen, die von Rubin (1976) formalisiert wurden:

  • MCAR (Missing Completely At Random): Das Fehlen eines Wertes ist völlig zufällig und hängt weder von den beobachteten noch von den fehlenden Werten ab. Beispiel: Ein Fragebogenbogen geht zufällig verloren.
  • MAR (Missing At Random): Das Fehlen hängt von anderen beobachteten Variablen ab, aber nicht vom fehlenden Wert selbst. Beispiel: Ältere Personen lassen eine Frage häufiger aus, aber das Alter ist bekannt.
  • MNAR (Missing Not At Random): Das Fehlen hängt vom Wert selbst ab, der fehlt. Beispiel: Personen mit sehr niedrigem Einkommen geben dieses seltener an.

Die Unterscheidung ist entscheidend, weil sie bestimmt, welche Methoden zur Behandlung fehlender Werte zulässig und sinnvoll sind – etwa listwise Deletion, Mean Imputation, Multiple Imputation oder Full Information Maximum Likelihood (FIML).

Einfach erklärt Stell dir vor, du hast eine Umfrage mit 200 Antworten, aber bei manchen Fragen fehlen Einträge. Eine Missing-Data-Analyse klärt: Fehlen diese Werte rein zufällig, oder steckt ein Muster dahinter – z. B. dass bestimmte Gruppen systematisch nicht geantwortet haben? Je nachdem, was du herausfindest, musst du anders mit den Lücken umgehen.

Warum ist Missing-Data-Analyse für statistische Analysen wichtig?

Fehlende Werte sind in der Praxis fast unvermeidlich – ob in Umfragedaten, klinischen Studien oder administrativen Datensätzen. Das Problem: Werden sie ignoriert oder falsch behandelt, können die Ergebnisse verzerrt und die Schlussfolgerungen einer Studie schlicht falsch sein.

Die häufigste Reaktion auf fehlende Daten ist der sogenannte vollständige Fallausschluss (listwise deletion), bei dem alle Beobachtungen mit mindestens einem fehlenden Wert aus der Analyse entfernt werden. Das ist nur dann unproblematisch, wenn MCAR vorliegt – also das Fehlen wirklich zufällig ist. Liegt hingegen MAR oder MNAR vor, führt dieser Ansatz zu verzerrten Schätzungen und einem Verlust statistischer Power.

Häufiger Fehler Viele Forschende ersetzen fehlende Werte einfach durch den Mittelwert der jeweiligen Variable (Mean Imputation). Das klingt praktisch, verzerrt aber systematisch die Varianz und die Korrelationen zwischen Variablen. Für inferenzstatistische Analysen ist diese Methode daher in der Regel nicht empfehlenswert.

Eine sorgfältige Missing-Data-Analyse umfasst deshalb mehrere Schritte:

  1. Quantifizierung: Wie viele Werte fehlen – insgesamt und pro Variable?
  2. Musteranalyse: Gibt es systematische Muster im Fehlen (z. B. durch Heatmaps oder Missing-Pattern-Tabellen)?
  3. Mechanismus-Prüfung: Gibt es Hinweise auf MCAR, MAR oder MNAR – z. B. durch Little’s MCAR-Test oder logistische Regressionen auf den Fehlend-Indikator?
  4. Methodenwahl: Welche Imputations- oder Schätzmethode ist unter dem identifizierten Mechanismus angemessen?
Gut zu wissen Als Faustregel gilt: Ab etwa 5 % fehlenden Werten in einer Variable sollte man den Mechanismus aktiv prüfen. Bei mehr als 20 % fehlenden Werten ist besondere Vorsicht geboten – unabhängig vom Mechanismus.

Praxisbeispiel zu Missing-Data-Analyse

Eine Psychologiestudentin untersucht in ihrer Masterarbeit den Zusammenhang zwischen Stresserleben und Schlafqualität bei 150 Studierenden. Nach der Datenerhebung stellt sie fest, dass bei der Skala zur Schlafqualität 18 Werte fehlen.

Sie führt eine Missing-Data-Analyse durch und schaut sich zunächst das Muster an: Wer hat diese Frage nicht beantwortet? Eine logistische Regression zeigt, dass Personen mit sehr hohem Stresswert die Schlaffrage signifikant häufiger übersprungen haben. Das deutet auf einen MNAR-Mechanismus hin – ausgerechnet jene, die vermutlich am schlechtesten schlafen, haben die Frage ausgelassen.

Tabelle 1. Fehlende Werte nach Stressniveau-Gruppe
Stressniveau n gesamt Fehlende Schlafwerte Fehlend-Anteil
Niedrig 60 2 3,3 %
Mittel 55 4 7,3 %
Hoch 35 12 34,3 %

Das Muster ist eindeutig: Je höher der Stress, desto häufiger fehlen die Schlafwerte. Ein einfacher Fallausschluss würde die Hochstress-Gruppe stark unterrepräsentieren und den Zusammenhang zwischen Stress und Schlaf abschwächen. Die Studentin entscheidet sich daher für eine sensitivitätsanalytische Vorgehensweise und diskutiert die Einschränkungen ihrer Ergebnisse im Methodenteil transparent.

Fehlende Werte MCAR MAR MNAR Imputation Datenqualität Deskriptive Statistik Datenvorbereitung

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!