Paneldaten
In diesem Beitrag
Was versteht man unter Paneldaten?
Paneldaten sind Datensätze, die sowohl eine Querschnittsdimension als auch eine Zeitreihendimension kombinieren. Das bedeutet: Dieselben Untersuchungseinheiten – etwa Personen, Unternehmen, Länder oder Haushalte – werden zu mehreren Zeitpunkten beobachtet und gemessen. Man spricht deshalb auch von Längsschnittdaten.
Formal lässt sich ein Paneldatensatz als eine Menge von Beobachtungen beschreiben, bei der jede Einheit i (mit i = 1, …, N) zu mehreren Zeitpunkten t (mit t = 1, …, T) gemessen wird. Jede Beobachtung trägt also einen doppelten Index: Sie gehört zu einer bestimmten Einheit und zu einem bestimmten Zeitpunkt.
Man unterscheidet zwei Grundtypen:
- Balanciertes Panel: Jede Einheit wird zu exakt denselben Zeitpunkten beobachtet – der Datensatz hat keine Lücken.
- Unbalanciertes Panel: Nicht alle Einheiten sind zu allen Zeitpunkten vorhanden, etwa weil Teilnehmende eine Studie verlassen oder Unternehmen insolvent gehen.
Warum sind Paneldaten für statistische Analysen wichtig?
Paneldaten bieten gegenüber reinen Querschnitts- oder Zeitreihendaten entscheidende Vorteile für die empirische Forschung:
- Kontrolle unbeobachtbarer Heterogenität: Jede Einheit bringt individuelle, stabile Eigenschaften mit – etwa Persönlichkeit, Unternehmenskultur oder geografische Lage –, die sich kaum direkt messen lassen. Panelmodelle wie das Fixed-Effects-Modell oder das Random-Effects-Modell können diese zeitkonstanten Einflüsse statistisch herausrechnen, was zu weniger verzerrten Schätzungen führt.
- Kausalanalyse: Weil Veränderungen innerhalb derselben Einheit über die Zeit beobachtet werden, lassen sich Ursache-Wirkungs-Zusammenhänge besser identifizieren als in reinen Querschnittsstudien.
- Größere Informationsdichte: Durch die doppelte Dimension (Einheiten × Zeitpunkte) stehen mehr Beobachtungen zur Verfügung, was die statistische Schätzgenauigkeit erhöht.
Praxisbeispiel zu Paneldaten
Eine Forscherin untersucht, ob ein betriebliches Weiterbildungsprogramm den Stundenlohn von Beschäftigten erhöht. Sie zieht eine Stichprobe von 500 Arbeitnehmenden und erhebt deren Lohn sowie Teilnahmestatus an der Weiterbildung – und das nicht nur einmal, sondern jährlich über vier Jahre.
| Person (i) | Jahr (t) | Stundenlohn (€) | Weiterbildung |
|---|---|---|---|
| Person 1 | 2020 | 14,50 | Nein |
| Person 1 | 2021 | 14,80 | Nein |
| Person 1 | 2022 | 16,20 | Ja |
| Person 1 | 2023 | 16,90 | Ja |
| Person 2 | 2020 | 18,00 | Nein |
| Person 2 | 2021 | 18,10 | Nein |
| Person 2 | 2022 | 18,30 | Nein |
| Person 2 | 2023 | 18,50 | Nein |
Der Vorteil gegenüber einem einfachen Querschnitt wird hier sofort sichtbar: Person 1 und Person 2 unterscheiden sich ohnehin im Ausgangslohn – Person 2 verdient von Beginn an mehr. Würde man nur einen einzigen Messzeitpunkt betrachten, könnte man nicht sauber trennen, ob höhere Löhne auf die Weiterbildung oder auf individuelle Merkmale zurückgehen. Mit Paneldaten und einem Fixed-Effects-Modell hingegen vergleicht man jede Person nur mit sich selbst über die Zeit und kann den Weiterbildungseffekt so sauberer isolieren.