Heckman-Korrektur
In diesem Beitrag
Was versteht man unter der Heckman-Korrektur?
Die Heckman-Korrektur ist ein zweistufiges ökonometrisches Verfahren, das den Selektionsbias in Regressionsmodellen korrigiert. Selektionsbias entsteht, wenn die Stichprobe, auf der ein Modell geschätzt wird, nicht zufällig aus der Grundgesamtheit stammt, sondern systematisch verzerrt ist – weil bestimmte Beobachtungen nur dann in die Daten eingehen, wenn eine bestimmte Bedingung erfüllt ist.
Das Verfahren wurde vom Ökonomen James Heckman entwickelt, der dafür im Jahr 2000 den Nobelpreis für Wirtschaftswissenschaften erhielt. Es gliedert sich in zwei Stufen:
- Probit-Modell (Selektionsgleichung): In der ersten Stufe wird modelliert, ob eine Beobachtung überhaupt in die Stichprobe gelangt – also ob die abhängige Variable beobachtbar ist. Aus diesem Modell wird die sogenannte Inverse Mills Ratio (IMR) berechnet.
- Ergebnisgleichung: In der zweiten Stufe wird das eigentliche Regressionsmodell geschätzt, wobei die IMR als zusätzliche erklärende Variable aufgenommen wird. Sie fungiert als Kontrollterm für die Selektionsverzerrung.
Die Inverse Mills Ratio ergibt sich aus dem Verhältnis der Dichtefunktion zur Verteilungsfunktion der Standardnormalverteilung, ausgewertet an dem in Stufe 1 geschätzten Index:
Inverse Mills Ratio
Dabei ist die Standardnormalverteilungs-Dichtefunktion, die kumulative Verteilungsfunktion und der aus der Selektionsgleichung geschätzte lineare Index.
Warum ist die Heckman-Korrektur für statistische Analysen wichtig?
Wer eine Regression auf einer selektiv beobachteten Stichprobe schätzt, ohne diese Selektion zu berücksichtigen, erhält verzerrte und inkonsistente Koeffizientenschätzer. Das klassische OLS-Modell setzt voraus, dass der Fehlerterm unkorreliert mit den erklärenden Variablen ist. Liegt Selektionsbias vor, ist diese Annahme verletzt – die Ergebnisse sind dann systematisch falsch, nicht nur ungenau.
Die Heckman-Korrektur ist immer dann sinnvoll, wenn:
- Beobachtungen nur unter bestimmten Bedingungen in die Stichprobe eingehen (z. B. nur Erwerbstätige, nur Kreditnehmer, nur Studienteilnehmer, die freiwillig mitmachen),
- die Selektionsentscheidung mit den Variablen des Hauptmodells zusammenhängt,
- und die abhängige Variable daher für einen nicht-zufälligen Teil der Grundgesamtheit fehlt.
Praxisbeispiel zur Heckman-Korrektur
Eine Forscherin möchte untersuchen, welche Faktoren den Stundenlohn von Frauen beeinflussen. Sie nutzt einen Datensatz mit 2.000 Frauen im erwerbsfähigen Alter. Allerdings sind Lohndaten nur für die 1.100 Frauen verfügbar, die tatsächlich erwerbstätig sind – für die übrigen 900 Frauen, die nicht arbeiten, fehlen die Lohnangaben.
Da die Entscheidung, erwerbstätig zu sein, von ähnlichen Faktoren abhängt wie der Lohn selbst (z. B. Bildung), liegt Selektionsbias vor. Eine einfache OLS-Regression auf den 1.100 Erwerbstätigen würde verzerrte Schätzer liefern.
Die Forscherin wendet die Heckman-Korrektur in zwei Schritten an:
| Stufe | Modell | Abhängige Variable | Wichtige erklärende Variablen |
|---|---|---|---|
| 1 | Probit (Selektionsgleichung) | Erwerbstätig? (Ja/Nein) | Bildung, Alter, Anzahl Kinder, Haushaltseinkommen ohne eigenen Lohn (Ausschlussbeschränkung) |
| 2 | OLS (Ergebnisgleichung) | Stundenlohn (log) | Bildung, Alter, Berufserfahrung, Inverse Mills Ratio |
Das Haushaltseinkommen ohne eigenen Lohn dient als Ausschlussbeschränkung: Es beeinflusst zwar die Entscheidung, erwerbstätig zu sein (ein hohes Haushaltseinkommen kann die Erwerbsneigung senken), hat aber keinen direkten Einfluss auf die Lohnhöhe selbst.
In der zweiten Stufe wird die geschätzte IMR in die Lohnregression aufgenommen. Ist der Koeffizient der IMR statistisch signifikant, bestätigt das, dass tatsächlich Selektionsbias vorlag und die Korrektur notwendig war. Die korrigierten Koeffizienten für Bildung und Berufserfahrung gelten nun als unverzerrte Schätzer des tatsächlichen Lohneffekts.