Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Einflussreiche Beobachtung

Influential Observation / Einflusspunkt · Maximilian Fuchs · 24. April 2026 · 5 Min. Lesezeit

Was versteht man unter einer einflussreichen Beobachtung?

Eine einflussreiche Beobachtung (engl. influential observation) ist ein einzelner Datenpunkt, dessen Entfernung aus dem Datensatz die Schätzergebnisse eines statistischen Modells – zum Beispiel die Regressionskoeffizienten – spürbar verändert. Solche Beobachtungen üben einen überproportionalen Einfluss auf das Modellergebnis aus und können die Schlussfolgerungen einer Analyse erheblich verfälschen.

In der Regressionsanalyse wird der Einfluss einer Beobachtung häufig mit dem sogenannten Cook’s Distance-Maß (Cook’s D) quantifiziert. Es misst, wie stark sich alle vorhergesagten Werte des Modells verändern, wenn die jeweilige Beobachtung aus der Schätzung entfernt wird:

Cook’s Distance

Dabei steht für die Anzahl der Beobachtungen, für die Anzahl der Modellparameter, für den vorhergesagten Wert bei vollständigem Datensatz und für den vorhergesagten Wert nach Entfernung der -ten Beobachtung. Als grobe Faustregel gilt ein Wert von als Hinweis auf eine potenziell einflussreiche Beobachtung.

Wichtig ist die Abgrenzung zu zwei verwandten Konzepten: Ein Ausreißer ist ein Datenpunkt mit einem ungewöhnlich großen Residuum, also einem großen Abstand zwischen beobachtetem und vorhergesagtem Wert. Ein Hebelpunkt (engl. leverage point) liegt weit außerhalb des Wertebereichs der erklärenden Variablen. Eine einflussreiche Beobachtung vereint oft beide Eigenschaften – sie muss es aber nicht. Ein Hebelpunkt mit kleinem Residuum kann durchaus wenig Einfluss haben.

Einfach erklärt: Stell dir vor, du zeichnest eine Regressionsgerade durch eine Punktwolke. Eine einflussreiche Beobachtung ist ein Datenpunkt, der diese Gerade so stark „zieht“, dass sie sich deutlich verschiebt oder dreht, sobald du ihn entfernst. Solche Punkte sitzen oft am Rand der Daten und passen nicht gut zum restlichen Muster.

Warum ist die einflussreiche Beobachtung für statistische Analysen wichtig?

Einflussreiche Beobachtungen können die Ergebnisse einer Regressionsanalyse stark verzerren – und das, ohne auf den ersten Blick aufzufallen. Ein einzelner Datenpunkt kann dazu führen, dass ein eigentlich nicht vorhandener Zusammenhang signifikant erscheint oder ein tatsächlich bestehender Zusammenhang verschleiert wird. Deshalb gehört die Prüfung auf einflussreiche Beobachtungen zur sorgfältigen Modelldiagnose.

Für die Praxis ergeben sich folgende Konsequenzen:

  • Modellstabilität prüfen: Verändert sich das Ergebnis stark, wenn einzelne Datenpunkte entfernt werden, ist das Modell möglicherweise nicht robust.
  • Ursache klären: Einflussreiche Beobachtungen können auf Messfehler, Dateneingabefehler oder aber auf echte, inhaltlich bedeutsame Sonderfälle hinweisen. Beides erfordert unterschiedliche Reaktionen.
  • Transparenz herstellen: In wissenschaftlichen Arbeiten sollte dokumentiert werden, ob und wie einflussreiche Beobachtungen behandelt wurden.
Häufiger Fehler: Einflussreiche Beobachtungen werden oft vorschnell als „Fehler“ gelöscht. Das ist problematisch, wenn der Datenpunkt inhaltlich valide ist. Eine Entfernung ohne Begründung kann die Analyse verzerren und ist wissenschaftlich nicht vertretbar. Besser ist es, die Analyse mit und ohne den Datenpunkt zu berichten.
Gut zu wissen: Neben Cook’s Distance gibt es weitere Diagnosemaße, etwa DFFITS (Difference in Fits) und DFBETAS, die gezielter messen, wie stark einzelne Regressionskoeffizienten durch einen Datenpunkt beeinflusst werden. Viele Statistiksoftware-Pakete wie R oder SPSS berechnen diese Maße automatisch.

Praxisbeispiel zu einflussreichen Beobachtungen

Eine Studentin untersucht in ihrer Masterarbeit, ob das monatliche Einkommen (in Euro) die Ausgaben für Weiterbildung vorhersagt. Sie befragt 20 Personen und schätzt eine lineare Regression.

Nach der Schätzung berechnet sie die Cook’s Distance für alle Beobachtungen und stellt fest, dass eine einzige Person – ein Unternehmensberater mit einem Einkommen von 15.000 Euro und Weiterbildungsausgaben von 3.000 Euro – einen Cook’s-D-Wert von 1,8 aufweist. Alle anderen Werte liegen unter 0,2.

Tabelle 1. Regressionskoeffizienten mit und ohne einflussreiche Beobachtung
Modell Intercept Steigung (Einkommen)
Vollständiger Datensatz (n = 20) 120 0,18 0,61
Ohne einflussreiche Beobachtung (n = 19) 95 0,09 0,34

Die Steigung halbiert sich nahezu und das Bestimmtheitsmaß R² sinkt deutlich, sobald dieser eine Datenpunkt entfernt wird. Die Studentin recherchiert und stellt fest, dass der Wert korrekt erhoben wurde. Sie berichtet beide Modelle in ihrer Arbeit und diskutiert, dass der starke Zusammenhang im Gesamtmodell maßgeblich durch diesen einen Extremfall getrieben wird – eine wichtige inhaltliche Einschränkung ihrer Ergebnisse.

Regressionsanalyse Ausreißer Cook’s Distance Modelldiagnose Hebelpunkt Residuenanalyse Robustheit

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!