Panelregression
In diesem Beitrag
Was versteht man unter Panelregression?
Die Panelregression ist ein Regressionsverfahren für Paneldaten – also Datensätze, die sowohl eine Querschnittsdimension (mehrere Einheiten, z. B. Personen, Unternehmen oder Länder) als auch eine Zeitreihendimension (mehrere Beobachtungszeitpunkte) aufweisen. Man spricht auch von longitudinalen Daten.
Das allgemeine Grundmodell der Panelregression lautet:
Grundmodell der Panelregression
Dabei bezeichnet den Wert der abhängigen Variable für Einheit i zum Zeitpunkt t, sind die unabhängigen Variablen und erfasst unbeobachtete, einheitenspezifische Effekte. Je nachdem, wie dieser Term modelliert wird, unterscheidet man die beiden wichtigsten Varianten:
- Fixed-Effects-Modell (FE): Die unbeobachteten individuellen Effekte werden als feste, konstante Parameter behandelt. Dadurch werden alle zeitkonstanten Unterschiede zwischen den Einheiten herausgerechnet. Das Modell schätzt nur die Variation innerhalb der Einheiten über die Zeit (Within-Schätzer).
- Random-Effects-Modell (RE): Die individuellen Effekte werden als zufällig und unkorreliert mit den Regressoren angenommen. Dieses Modell nutzt sowohl die Variation zwischen den Einheiten (Between) als auch die Variation innerhalb der Einheiten (Within).
Warum ist Panelregression für statistische Analysen wichtig?
Das entscheidende Vorzug der Panelregression liegt im Umgang mit unbeobachteter Heterogenität. In rein querschnittlichen Analysen können Merkmale, die nicht gemessen wurden, die Schätzergebnisse verzerren (Omitted Variable Bias). Durch die Mehrfachbeobachtung derselben Einheiten ermöglicht die Panelregression, solche Störgrößen zumindest teilweise zu kontrollieren – ohne sie direkt messen zu müssen.
Ein weiterer Vorteil ist die erhöhte Schätzeffizienz: Mehr Beobachtungen (durch die Zeitdimension) führen zu präziseren Koeffizientenschätzungen als ein einzelner Querschnitt.
Wahl zwischen Fixed und Random Effects
Die Wahl zwischen FE und RE ist eine der häufigsten Entscheidungen in der Panelanalyse. Als Entscheidungshilfe dient der Hausman-Test: Er prüft, ob die individuellen Effekte mit den Regressoren korreliert sind. Ist das der Fall, ist das FE-Modell konsistent; das RE-Modell wäre verzerrt.
Praxisbeispiel zu Panelregression
Eine Forscherin untersucht, wie die Forschungsausgaben (F&E-Intensität) den Jahresumsatz von Unternehmen beeinflussen. Sie hat Daten von 100 deutschen Unternehmen über einen Zeitraum von 5 Jahren (2018–2022) – also insgesamt 500 Beobachtungen.
| Unternehmen (i) | Jahr (t) | Umsatz (Mio. €) | F&E-Ausgaben (Mio. €) | Mitarbeiterzahl |
|---|---|---|---|---|
| Firma A | 2018 | 42,1 | 3,2 | 210 |
| Firma A | 2019 | 45,7 | 3,8 | 225 |
| Firma B | 2018 | 78,4 | 6,1 | 410 |
| Firma B | 2019 | 81,0 | 6,5 | 418 |
| … | … | … | … | … |
Würde die Forscherin einen einfachen OLS-Querschnitt verwenden, könnten unbeobachtete Unternehmensmerkmale – etwa Managementqualität oder Markenbekanntheit – die Schätzung des F&E-Effekts verzerren. Mit einem Fixed-Effects-Modell filtert sie diese zeitkonstanten Unterschiede heraus und schätzt nur, wie sich eine Veränderung der F&E-Ausgaben innerhalb desselben Unternehmens auf den Umsatz auswirkt.
Der Hausman-Test ergibt einen signifikanten p-Wert (p < 0,05), was darauf hindeutet, dass die individuellen Effekte mit den Regressoren korreliert sind. Die Forscherin entscheidet sich daher für das Fixed-Effects-Modell. Das Ergebnis zeigt: Eine Erhöhung der F&E-Ausgaben um 1 Mio. € geht im Mittel mit einem Umsatzanstieg von rund 4,3 Mio. € einher – kontrolliert für alle zeitkonstanten Unternehmenseigenschaften.