Random Intercept
In diesem Beitrag
Was versteht man unter einem Random Intercept?
Ein Random Intercept ist ein Bestandteil von gemischten Modellen (auch: Mixed Models oder Mehrebenenmodelle). Er beschreibt, dass der Ausgangswert – also der Achsenabschnitt – einer Regression nicht für alle Gruppen oder Personen identisch ist, sondern zwischen ihnen variiert. Dieser gruppenspezifische Achsenabschnitt wird als zufällig angesehen, weil die betrachteten Gruppen als eine Stichprobe aus einer größeren Population von Gruppen betrachtet werden.
Formal lässt sich ein einfaches Random-Intercept-Modell für eine Person i in Gruppe j so schreiben:
Modellgleichung
Dabei steht für den globalen Mittelwert des Achsenabschnitts (fixer Effekt), für die gruppenspezifische Abweichung davon (zufälliger Effekt) und für den individuellen Fehlerterm. Die zufälligen Abweichungen werden als normalverteilt mit Mittelwert 0 und einer bestimmten Varianz angenommen.
Warum ist der Random Intercept für statistische Analysen wichtig?
In der Praxis sind Daten häufig hierarchisch strukturiert: Schülerinnen und Schüler sitzen in Klassen, Patienten werden von bestimmten Ärztinnen und Ärzten behandelt, Messwiederholungen stammen von denselben Personen. Solche Daten verletzen die klassische Annahme der Unabhängigkeit der Beobachtungen – Beobachtungen innerhalb einer Gruppe ähneln sich systematisch.
Der Random Intercept löst dieses Problem, indem er die gruppenspezifischen Unterschiede im Ausgangsniveau explizit modelliert. Das hat mehrere Vorteile:
- Korrekte Standardfehler: Wird die Abhängigkeit innerhalb von Gruppen ignoriert, sind Standardfehler oft zu klein – Signifikanztests werden damit unzuverlässig.
- Effiziente Schätzung: Informationen aus allen Gruppen werden gleichzeitig genutzt, ohne auf gruppeninterne Analysen beschränkt zu sein.
- Partielle Varianzaufklärung: Die Varianz des Random Intercepts zeigt, wie stark sich Gruppen im Ausgangsniveau unterscheiden.
Praxisbeispiel zu Random Intercept
Eine Forscherin untersucht, ob die tägliche Lernzeit den Prüfungserfolg von Studierenden beeinflusst. Die Studierenden sind auf fünf verschiedene Tutorien verteilt. Die Forscherin vermutet, dass die Tutorien sich in ihrer Qualität unterscheiden und dadurch das durchschnittliche Prüfungsniveau variiert.
Sie schätzt ein Random-Intercept-Modell, in dem die Lernzeit als fixer Prädiktor eingeht, der Achsenabschnitt jedoch für jedes Tutorium variieren darf. Das Ergebnis könnte so aussehen:
| Tutorium | Globaler Intercept | Gruppenabweichung (u₀ⱼ) | Tutorium-spez. Intercept |
|---|---|---|---|
| A | 60 | +8 | 68 |
| B | 60 | +3 | 63 |
| C | 60 | 0 | 60 |
| D | 60 | −4 | 56 |
| E | 60 | −7 | 53 |
Über alle Tutorien hinweg liegt der durchschnittliche Ausgangswert (ohne Berücksichtigung der Lernzeit) bei 60 Punkten. Tutorium A liegt jedoch systematisch höher, Tutorium E systematisch niedriger. Das Random-Intercept-Modell erkennt diese Unterschiede und rechnet sie heraus – so wird der Effekt der Lernzeit nicht durch unterschiedliche Tutoriumsqualität verzerrt.