Endogenität
In diesem Beitrag
Was versteht man unter Endogenität?
Endogenität liegt in einem Regressionsmodell vor, wenn eine oder mehrere erklärende Variablen (Regressoren) mit dem Fehlerterm des Modells korreliert sind. In der klassischen linearen Regression lautet die Annahme, dass der Fehlerterm unkorreliert mit allen Regressoren ist:
Grundannahme der OLS-Regression (verletzt bei Endogenität)
Ist diese Bedingung verletzt – gilt also – spricht man von Endogenität. Der betroffene Regressor heißt dann endogene Variable. Im Gegensatz dazu stehen exogene Variablen, die mit dem Fehlerterm unkorreliert sind und damit die Grundannahme erfüllen.
Endogenität entsteht typischerweise durch drei Ursachen:
- Omitted Variable Bias (ausgelassene Variablen): Eine relevante Variable wird nicht ins Modell aufgenommen und landet dadurch im Fehlerterm – korreliert aber gleichzeitig mit einem Regressor.
- Simultanität (umgekehrte Kausalität): Die abhängige Variable beeinflusst ihrerseits die erklärende Variable – Ursache und Wirkung lassen sich nicht klar trennen.
- Messfehler: Wird ein Regressor mit systematischen Fehlern gemessen, schlägt dieser Fehler auf den Fehlerterm durch und erzeugt eine Korrelation.
Warum ist Endogenität für statistische Analysen wichtig?
Endogenität ist eines der gravierendsten Probleme in der angewandten Regressionsanalyse, weil sie die Schätzung mit der Ordinary Least Squares (OLS)-Methode verzerrt. Die geschätzten Koeffizienten sind dann weder konsistent noch erwartungstreu – das heißt, sie geben nicht den wahren Zusammenhang zwischen den Variablen wieder, selbst wenn die Stichprobe sehr groß ist.
Das ist besonders kritisch, wenn das Ziel der Analyse die Identifikation von Kausaleffekten ist – zum Beispiel in Wirtschafts-, Sozial- oder Gesundheitswissenschaften. Wer Endogenität ignoriert, zieht möglicherweise falsche Schlüsse über Ursache-Wirkungs-Beziehungen.
Zur Diagnose und Behebung von Endogenität gibt es verschiedene Ansätze:
- Instrumentalvariablen-Schätzung (IV): Eine externe Variable (Instrument) wird eingesetzt, die mit dem endogenen Regressor korreliert, aber nicht direkt mit dem Fehlerterm.
- Two-Stage Least Squares (2SLS): Eine spezielle IV-Methode, die in zwei Schritten vorgeht.
- Paneldaten mit Fixed Effects: Durch die Kontrolle zeitinvarianter, unbeobachteter Faktoren kann Endogenität teilweise reduziert werden.
- Regression Discontinuity Design oder natürliche Experimente: Quasi-experimentelle Designs, die Endogenität durch den Forschungsaufbau umgehen.
Praxisbeispiel zu Endogenität
Eine Forscherin untersucht, ob ein höheres Bildungsniveau zu einem höheren Einkommen führt. Sie schätzt folgendes OLS-Modell:
Regressionsmodell
Das Problem: Individuelle Fähigkeiten wie Intelligenz oder Motivation beeinflussen sowohl die Entscheidung, länger in Bildung zu investieren, als auch das spätere Einkommen. Diese Variable ist jedoch nicht beobachtbar und landet deshalb im Fehlerterm . Da Bildung und Fähigkeiten korreliert sind, ist Bildung endogen – und der OLS-Schätzer überschätzt den wahren Bildungseffekt.
| Ursache | Beispiel | Möglicher Lösungsansatz |
|---|---|---|
| Ausgelassene Variable | Fähigkeiten fehlen im Bildungs-Einkommens-Modell | Instrumentalvariable (z. B. Entfernung zur nächsten Uni) |
| Simultanität | Werbung ↔ Umsatz beeinflussen sich gegenseitig | 2SLS, natürliches Experiment |
| Messfehler | Selbsteingeschätzter Gesundheitsstatus als Regressor | Instrumentalvariable, Validierungsdaten |
Ein klassisches Instrument für Bildung ist die geografische Entfernung zur nächsten Universität (nach Card, 1995): Sie beeinflusst die Bildungsentscheidung, hat aber keinen direkten Effekt auf das Einkommen – damit erfüllt sie die Anforderungen an ein gültiges Instrument.