Hierarchisches lineares Modell
In diesem Beitrag
Was versteht man unter dem hierarchischen linearen Modell?
Das hierarchische lineare Modell (HLM) ist ein statistisches Verfahren, das speziell für die Analyse von Daten entwickelt wurde, die eine verschachtelte oder gruppierte Struktur aufweisen. Man spricht auch von einem Mehrebenenmodell oder Multilevel-Modell. Die Grundidee ist, dass Beobachtungen innerhalb derselben Gruppe einander ähnlicher sind als Beobachtungen aus verschiedenen Gruppen – und dass dieses Muster im Modell explizit berücksichtigt wird.
Typische Hierarchien in der Forschungspraxis sind etwa:
- Schülerinnen und Schüler (Ebene 1) sind in Schulklassen eingebettet (Ebene 2), die wiederum zu Schulen gehören (Ebene 3).
- Patientinnen und Patienten (Ebene 1) werden von verschiedenen Ärztinnen und Ärzten behandelt (Ebene 2).
- Messzeitpunkte (Ebene 1) sind innerhalb von Personen verschachtelt (Ebene 2) – etwa bei Längsschnittstudien.
Das einfachste Zweiebenmodell hat die folgende formale Struktur. Auf Ebene 1 (Individuen) gilt:
Ebene-1-Gleichung
Dabei ist der Outcome-Wert der Person i in Gruppe j, der gruppenspezifische Intercept, der gruppenspezifische Slope für den Prädiktor , und der individuelle Fehlerterm.
Auf Ebene 2 (Gruppen) werden die gruppenspezifischen Parameter selbst modelliert – zum Beispiel der Intercept:
Ebene-2-Gleichung (Intercept)
Hier ist der übergeordnete Gesamtmittelwert (Grand Mean), der Effekt einer Gruppencharakteristik auf den Intercept, und die zufällige Abweichung der Gruppe j vom Gesamtmittelwert.
Warum ist das hierarchische lineare Modell für statistische Analysen wichtig?
Viele klassische Verfahren wie die einfache lineare Regression setzen voraus, dass alle Beobachtungen voneinander unabhängig sind. Diese Annahme ist bei geschachtelten Daten fast immer verletzt. Wenn man das ignoriert, passieren zwei typische Fehler:
- Unterschätzung der Standardfehler: Die Standardfehler werden zu klein, was dazu führt, dass Effekte fälschlicherweise als statistisch signifikant ausgewiesen werden (erhöhte Typ-I-Fehlerrate).
- Verzerrte Parameterschätzungen: Gruppeneffekte und individuelle Effekte werden vermischt, sodass Zusammenhänge auf der falschen Ebene interpretiert werden. Dieses Phänomen ist als ökologischer Fehlschluss oder Atomistic Fallacy bekannt.
Das HLM löst dieses Problem, indem es die Varianz auf den verschiedenen Ebenen getrennt schätzt. Außerdem erlaubt es zu prüfen, ob Effekte auf Individualebene je nach Gruppe unterschiedlich stark ausfallen – sogenannte Cross-Level-Interaktionen.
Ein weiterer Vorteil: Das Verfahren ist robust gegenüber ungleich großen Gruppen, was in der Praxis häufig vorkommt.
Praxisbeispiel zu Hierarchisches lineares Modell
Eine Bildungsforscherin untersucht, ob die tägliche Lesezeit den Lesekompetenz-Score von Grundschulkindern beeinflusst. Die Daten umfassen 600 Kinder aus 30 Klassen (je ca. 20 Kinder pro Klasse).
Zuerst berechnet sie die Intraklassenkorrelation (ICC). Diese gibt an, wie viel Prozent der Gesamtvarianz im Outcome auf Unterschiede zwischen den Klassen zurückzuführen ist. Das Ergebnis: ICC = 0,18. Das bedeutet, 18 % der Varianz im Lesekompetenz-Score liegt auf Klassenebene – ein deutliches Signal, dass eine Mehrebenenanalyse notwendig ist.
| Prädiktor | Ebene | Koeffizient | Standardfehler | p-Wert |
|---|---|---|---|---|
| Intercept (Grand Mean) | 2 (Klasse) | 52,3 | 1,4 | < .001 |
| Tägliche Lesezeit (Min.) | 1 (Kind) | 0,41 | 0,08 | < .001 |
| Klassengröße | 2 (Klasse) | −0,30 | 0,15 | .045 |
Die Ergebnisse zeigen: Jede zusätzliche Minute täglicher Lesezeit ist mit einem um 0,41 Punkte höheren Lesekompetenz-Score assoziiert – und das unter Kontrolle der Klassenebene. Größere Klassen gehen zudem mit etwas niedrigeren Scores einher. Hätte die Forscherin stattdessen eine einfache Regression ohne Berücksichtigung der Klassenstruktur gerechnet, wären die Standardfehler zu klein ausgefallen und die Schlussfolgerungen potenziell irreführend.