Mahalanobis-Distanz
In diesem Beitrag
Was versteht man unter der Mahalanobis-Distanz?
Die Mahalanobis-Distanz ist ein Abstandsmaß, das beschreibt, wie weit ein einzelner Datenpunkt vom Zentrum einer Verteilung entfernt ist – und zwar unter Berücksichtigung der Streuung und der Korrelationsstruktur der Daten. Sie wurde 1936 vom indischen Statistiker Prasanta Chandra Mahalanobis entwickelt.
Mathematisch ist die Mahalanobis-Distanz D eines Beobachtungsvektors vom Mittelwertsvektor wie folgt definiert:
Formel: Mahalanobis-Distanz
Dabei ist die Kovarianzmatrix der Daten. Das Quadrat der Mahalanobis-Distanz, , folgt bei multivariat normalverteilten Daten einer Chi-Quadrat-Verteilung mit p Freiheitsgraden, wobei p die Anzahl der Variablen ist.
Im Unterschied zur gewöhnlichen euklidischen Distanz berücksichtigt die Mahalanobis-Distanz zwei wichtige Eigenschaften der Daten:
- Unterschiedliche Streuungen: Variablen mit großer Streuung werden relativ weniger stark gewichtet.
- Korrelationen zwischen Variablen: Wenn zwei Variablen stark korreliert sind, wird dies beim Abstandsmaß einkalkuliert.
Warum ist die Mahalanobis-Distanz für statistische Analysen wichtig?
Die Mahalanobis-Distanz hat in der angewandten Statistik gleich mehrere wichtige Einsatzgebiete:
Erkennung multivariater Ausreißer
Das häufigste Anwendungsgebiet ist die Identifikation von Ausreißern in multivariaten Datensätzen. Ein Datenpunkt, der bei jeder einzelnen Variable unauffällig ist, kann in der Kombination dennoch extrem vom Gesamtmuster abweichen. Genau das macht die Mahalanobis-Distanz sichtbar. Als Faustregel gilt: Datenpunkte, deren einen kritischen Chi-Quadrat-Wert überschreitet (z. B. bei p = 2 Variablen und α = 0,001: ≈ 13,82), werden als multivariate Ausreißer betrachtet.
Voraussetzungsprüfung für multivariate Verfahren
Viele multivariate Verfahren – etwa die multivariate Varianzanalyse (MANOVA), die Diskriminanzanalyse oder die konfirmatorische Faktorenanalyse – setzen multivariate Normalverteilung voraus. Die Mahalanobis-Distanz ist ein gängiges Werkzeug, um diese Voraussetzung zu prüfen und auffällige Beobachtungen zu identifizieren, die die Analyse verzerren könnten.
Klassifikation und maschinelles Lernen
In der Diskriminanzanalyse wird die Mahalanobis-Distanz genutzt, um neue Beobachtungen derjenigen Gruppe zuzuordnen, zu deren Zentrum sie am nächsten liegen – unter Berücksichtigung der jeweiligen Streuungsstruktur.
Praxisbeispiel zur Mahalanobis-Distanz
Angenommen, du untersuchst in deiner Masterarbeit den Zusammenhang zwischen Lernzeit (in Stunden pro Woche) und Prüfungsnote bei Studierenden. Der Mittelwert liegt bei 15 Stunden Lernzeit und einer Note von 2,5. Die Standardabweichung für Lernzeit beträgt 3 Stunden, für die Note 0,5 Notenpunkte, und beide Variablen korrelieren mit r = 0,6.
Nun betrachtest du zwei auffällige Studierende:
| Studierende/r | Lernzeit (h/Woche) | Note | Mahalanobis-Distanz D | Interpretation |
|---|---|---|---|---|
| Person A | 22 | 1,5 | 3,1 | Lernt viel, hat gute Note – konsistentes Muster, aber etwas außergewöhnlich |
| Person B | 22 | 4,0 | 6,8 | Lernt viel, hat aber eine schlechte Note – ungewöhnliche Kombination, potenzieller Ausreißer |
Person A hat zwar eine überdurchschnittliche Lernzeit, aber auch eine entsprechend gute Note – das passt zur Korrelationsstruktur der Daten. Person B hingegen lernt ebenfalls viel, hat aber eine schlechte Note. Diese Kombination ist im Datensatz ungewöhnlich und führt zu einer deutlich größeren Mahalanobis-Distanz. Bei zwei Variablen und α = 0,001 liegt der kritische Chi-Quadrat-Wert bei ca. 13,82 – Person B wäre hier noch kein formaler Ausreißer, würde aber zur näheren Prüfung markiert werden.
Dieses Beispiel zeigt: Erst durch die Berücksichtigung der Korrelation zwischen Lernzeit und Note wird deutlich, welche Beobachtung wirklich auffällig ist.