Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Logistische Regression

Logistic Regression · Maximilian Fuchs · 24. April 2026 · 6 Min. Lesezeit

Was versteht man unter Logistischer Regression?

Die logistische Regression ist ein statistisches Verfahren zur Modellierung von binären oder kategorialen Zielvariablen. Im Unterschied zur linearen Regression, die einen kontinuierlichen Wert vorhersagt, schätzt die logistische Regression die Wahrscheinlichkeit, dass ein Ereignis eintritt – etwa ob eine Person eine Krankheit hat oder nicht, ob ein Studierender eine Prüfung besteht oder nicht.

Das Herzstück des Modells ist die sogenannte logistische Funktion (auch Sigmoid-Funktion genannt), die jeden beliebigen reellen Wert auf einen Bereich zwischen 0 und 1 abbildet:

Logistische Funktion

Dabei steht p für die geschätzte Wahrscheinlichkeit, e für die Eulersche Zahl und z für die Linearkombination der Prädiktoren:

Linearkombination der Prädiktoren

Die Koeffizienten geben an, wie stark und in welche Richtung jede erklärende Variable X die Wahrscheinlichkeit des Ereignisses beeinflusst. Sie werden nicht über die Methode der kleinsten Quadrate, sondern über die Maximum-Likelihood-Schätzung bestimmt.

Häufig werden die Koeffizienten in Form von Odds Ratios interpretiert: Ein Odds Ratio größer als 1 bedeutet, dass die Wahrscheinlichkeit für das Ereignis mit steigendem Prädiktor zunimmt; ein Wert kleiner als 1 bedeutet das Gegenteil.

Einfach erklärt: Stell dir vor, du willst wissen, ob jemand eine Prüfung besteht – ja oder nein. Die logistische Regression schaut sich verschiedene Einflussfaktoren an (z. B. Lernstunden, Vorwissen) und berechnet daraus eine Wahrscheinlichkeit zwischen 0 % und 100 %. Liegt die Wahrscheinlichkeit über einem bestimmten Schwellenwert (meist 50 %), trifft das Modell die Vorhersage „bestanden“.

Warum ist Logistische Regression für statistische Analysen wichtig?

Die logistische Regression ist eines der meistgenutzten Verfahren in der empirischen Forschung – und das aus gutem Grund. Sie ist vielseitig, gut interpretierbar und in nahezu allen Statistiksoftwarepaketen verfügbar. Typische Anwendungsfelder sind:

  • Medizin: Vorhersage des Erkrankungsrisikos auf Basis von Patientenmerkmalen
  • Sozialwissenschaften: Analyse von Abstimmungsverhalten oder Bildungsentscheidungen
  • Wirtschaft: Kreditwürdigkeitsprüfung oder Kundenabwanderungsanalyse
  • Psychologie: Vorhersage klinischer Diagnosen anhand von Testergebnissen

Entscheidend ist, dass die logistische Regression nicht nur eine Klassifikation liefert, sondern auch die Stärke und Richtung einzelner Einflussfaktoren quantifiziert und auf statistische Signifikanz prüft.

Häufiger Fehler: Die logistische Regression setzt voraus, dass die Beobachtungen unabhängig voneinander sind und keine extreme Multikollinearität zwischen den Prädiktoren besteht. Außerdem sollte die Stichprobe groß genug sein – als Faustregel gelten mindestens 10 Ereignisse pro Prädiktor im Modell. Werden diese Voraussetzungen ignoriert, können die Schätzungen verzerrt und die Standardfehler unzuverlässig sein.
Gut zu wissen: Die logistische Regression lässt sich auf mehr als zwei Kategorien erweitern. Bei mehr als zwei ungeordneten Kategorien spricht man von multinomialer logistischer Regression, bei geordneten Kategorien von ordinaler logistischer Regression.

Praxisbeispiel zu Logistischer Regression

Eine Forscherin untersucht, welche Faktoren die Wahrscheinlichkeit beeinflussen, dass Studierende eine Statistikprüfung bestehen. Sie erhebt die Daten von 200 Studierenden und verwendet als Prädiktoren die wöchentlichen Lernstunden sowie die Note in einer Vorgängerveranstaltung.

Tabelle 1. Ergebnisse der logistischen Regression (N = 200)
Prädiktor Koeffizient (b) Odds Ratio p-Wert
Lernstunden pro Woche 0.42 1.52 .003
Note Vorgängerveranstaltung 0.71 2.03 <.001
Konstante (Intercept) −2.10 .012

Interpretation: Das Odds Ratio von 1.52 für die Lernstunden bedeutet: Jede zusätzliche Lernstunde pro Woche erhöht die Chance, die Prüfung zu bestehen, um den Faktor 1.52 – also um etwa 52 %. Der Effekt der Vorgängernote ist noch stärker: Studierende mit einer um eine Einheit besseren Note haben eine mehr als doppelt so hohe Chance zu bestehen (OR = 2.03). Beide Prädiktoren sind statistisch signifikant.

Erhält die Forscherin nun einen neuen Studierenden mit 5 Lernstunden pro Woche und einer Vorgängernote von 2.0, kann das Modell direkt eine geschätzte Bestehenswahrscheinlichkeit berechnen – ein konkreter, praktisch nutzbarer Output.

Logistische Regression Binäre Zielvariable Odds Ratio Wahrscheinlichkeitsschätzung Maximum-Likelihood Klassifikation Regressionsanalyse Multivariat

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!