Logistische Regression
In diesem Beitrag
Was versteht man unter Logistischer Regression?
Die logistische Regression ist ein statistisches Verfahren zur Modellierung von binären oder kategorialen Zielvariablen. Im Unterschied zur linearen Regression, die einen kontinuierlichen Wert vorhersagt, schätzt die logistische Regression die Wahrscheinlichkeit, dass ein Ereignis eintritt – etwa ob eine Person eine Krankheit hat oder nicht, ob ein Studierender eine Prüfung besteht oder nicht.
Das Herzstück des Modells ist die sogenannte logistische Funktion (auch Sigmoid-Funktion genannt), die jeden beliebigen reellen Wert auf einen Bereich zwischen 0 und 1 abbildet:
Logistische Funktion
Dabei steht p für die geschätzte Wahrscheinlichkeit, e für die Eulersche Zahl und z für die Linearkombination der Prädiktoren:
Linearkombination der Prädiktoren
Die Koeffizienten geben an, wie stark und in welche Richtung jede erklärende Variable X die Wahrscheinlichkeit des Ereignisses beeinflusst. Sie werden nicht über die Methode der kleinsten Quadrate, sondern über die Maximum-Likelihood-Schätzung bestimmt.
Häufig werden die Koeffizienten in Form von Odds Ratios interpretiert: Ein Odds Ratio größer als 1 bedeutet, dass die Wahrscheinlichkeit für das Ereignis mit steigendem Prädiktor zunimmt; ein Wert kleiner als 1 bedeutet das Gegenteil.
Warum ist Logistische Regression für statistische Analysen wichtig?
Die logistische Regression ist eines der meistgenutzten Verfahren in der empirischen Forschung – und das aus gutem Grund. Sie ist vielseitig, gut interpretierbar und in nahezu allen Statistiksoftwarepaketen verfügbar. Typische Anwendungsfelder sind:
- Medizin: Vorhersage des Erkrankungsrisikos auf Basis von Patientenmerkmalen
- Sozialwissenschaften: Analyse von Abstimmungsverhalten oder Bildungsentscheidungen
- Wirtschaft: Kreditwürdigkeitsprüfung oder Kundenabwanderungsanalyse
- Psychologie: Vorhersage klinischer Diagnosen anhand von Testergebnissen
Entscheidend ist, dass die logistische Regression nicht nur eine Klassifikation liefert, sondern auch die Stärke und Richtung einzelner Einflussfaktoren quantifiziert und auf statistische Signifikanz prüft.
Praxisbeispiel zu Logistischer Regression
Eine Forscherin untersucht, welche Faktoren die Wahrscheinlichkeit beeinflussen, dass Studierende eine Statistikprüfung bestehen. Sie erhebt die Daten von 200 Studierenden und verwendet als Prädiktoren die wöchentlichen Lernstunden sowie die Note in einer Vorgängerveranstaltung.
| Prädiktor | Koeffizient (b) | Odds Ratio | p-Wert |
|---|---|---|---|
| Lernstunden pro Woche | 0.42 | 1.52 | .003 |
| Note Vorgängerveranstaltung | 0.71 | 2.03 | <.001 |
| Konstante (Intercept) | −2.10 | — | .012 |
Interpretation: Das Odds Ratio von 1.52 für die Lernstunden bedeutet: Jede zusätzliche Lernstunde pro Woche erhöht die Chance, die Prüfung zu bestehen, um den Faktor 1.52 – also um etwa 52 %. Der Effekt der Vorgängernote ist noch stärker: Studierende mit einer um eine Einheit besseren Note haben eine mehr als doppelt so hohe Chance zu bestehen (OR = 2.03). Beide Prädiktoren sind statistisch signifikant.
Erhält die Forscherin nun einen neuen Studierenden mit 5 Lernstunden pro Woche und einer Vorgängernote von 2.0, kann das Modell direkt eine geschätzte Bestehenswahrscheinlichkeit berechnen – ein konkreter, praktisch nutzbarer Output.