Wie berechnet man eine Überlebensanalyse?
In diesem Beitrag
- Was ist eine Überlebensanalyse – und wann brauchen Sie sie?
- Datenstruktur: Zeit, Ereignis und Zensierung
- Schritt 1: Die Kaplan-Meier-Kurve berechnen
- Schritt 2: Gruppen vergleichen mit dem Log-Rank-Test
- Schritt 3: Kovariaten modellieren mit der Cox-Regression
- Praktische Umsetzung in R
- Typische Fehler bei der Überlebensanalyse
- Zusammenfassung: Der Analyseablauf im Überblick
Was ist eine Überlebensanalyse – und wann brauchen Sie sie?
Die Überlebensanalyse (englisch: Survival Analysis) ist ein statistisches Verfahren zur Analyse der Zeit bis zum Eintreten eines definierten Ereignisses. Dieses Ereignis muss nicht zwingend der Tod sein – es kann sich um Rückfall, Entlassung, Remission, Therapieabbruch oder jedes andere eindeutig definierbare Outcome handeln.
Der entscheidende Unterschied zu gewöhnlichen Analyseverfahren liegt in der Datenstruktur: Nicht alle Personen erleben das Ereignis während des Beobachtungszeitraums. Einige fallen vorzeitig aus der Studie heraus, andere werden noch beobachtet, wenn die Studie endet. Diese sogenannten zensierten Beobachtungen lassen sich weder einfach weglassen noch wie vollständige Daten behandeln – beides würde zu verzerrten Ergebnissen führen.
Genau deshalb reichen weder Mittelwertvergleiche noch lineare Regressionsmodelle für Time-to-Event-Daten aus: Überlebensdaten sind in der Regel zensiert, und klassische Analysemethoden können diese Datenstruktur nicht korrekt abbilden. Die Überlebensanalyse löst dieses Problem methodisch sauber.
Typische Einsatzgebiete in der Medizin sind klinische Studien, onkologische Auswertungen, epidemiologische Kohortenstudien und – besonders häufig – die medizinische Doktorarbeit. Wer beispielsweise das Überleben zweier Patientengruppen unter unterschiedlichen Therapien vergleicht, kommt an diesem Verfahren nicht vorbei.
Datenstruktur: Zeit, Ereignis und Zensierung
Bevor Sie eine Überlebensanalyse berechnen können, muss die Datenstruktur stimmen. Sie benötigen für jede Person mindestens zwei Variablen:
- Zeitvariable: Die Dauer vom Startpunkt bis zum Ereignis oder bis zum letzten Beobachtungszeitpunkt (z. B. Tage, Monate, Jahre)
- Ereignisvariable (Status): Ein dichotomer Indikator, ob das Ereignis eingetreten ist (1 = Ereignis, 0 = zensiert)
Wichtig ist, dass sowohl der Ursprung der Beobachtungszeit als auch der Zeitpunkt des Endereignisses eindeutig und konsistent definiert sein müssen, bevor Sie mit der Berechnung beginnen. Eine unscharfe Definition des Startpunkts – etwa „irgendwann nach Diagnosestellung“ – macht alle nachfolgenden Berechnungen methodisch angreifbar.
Rechtszensierung und Linkszensierung
Rechtszensierung ist die bei weitem häufigste Form: Das Ereignis tritt während des Beobachtungszeitraums nicht ein, oder die Person scheidet vorzeitig aus (Loss to Follow-up, Studienende). In diesem Fall kennen Sie die Überlebenszeit bis zum Beobachtungsende, aber nicht, ob und wann das Ereignis danach noch eingetreten ist.
Linkszensierung liegt vor, wenn das Ereignis bereits vor dem definierten Startpunkt der Beobachtung eingetreten ist. Dieses Szenario ist seltener, kommt aber in retrospektiven Studien vor.
Schritt 1: Die Kaplan-Meier-Kurve berechnen
Die Kaplan-Meier-Methode ist der Ausgangspunkt nahezu jeder Überlebensanalyse. Sie schätzt die Überlebensfunktion – also die Wahrscheinlichkeit, bis zum Zeitpunkt ereignisfrei zu bleiben – auf Basis der tatsächlich beobachteten Daten, ohne eine bestimmte Verteilung vorauszusetzen.
Kaplan-Meier-Schätzer
Dabei ist die Anzahl der Ereignisse zum Zeitpunkt und die Anzahl der zu diesem Zeitpunkt noch unter Beobachtung stehenden Personen (sogenannte at risk-Population). Das Produkt läuft über alle Ereigniszeitpunkte bis zu .
Was die Kaplan-Meier-Kurve zeigt
Das Ergebnis ist eine Treppenkurve: Die Überlebenswahrscheinlichkeit beginnt bei 1,0 (100 %) und sinkt bei jedem Ereigniszeitpunkt stufenweise ab. Zensierte Beobachtungen werden in der Kurve häufig durch ein kleines Strichsymbol markiert.
Inhaltlich lässt sich aus der Kurve ablesen: Wie hoch ist die Überlebenswahrscheinlichkeit nach 12, 24 oder 36 Monaten? Wann ist die Hälfte der Personen das Ereignis erlebt (Median der Überlebenszeit)? Die Kurve ist damit nicht nur ein Rechenergebnis, sondern ein zentrales visuelles Kommunikationsmittel in medizinischen Publikationen.
Schritt 2: Gruppen vergleichen mit dem Log-Rank-Test
Wenn Sie die Überlebenszeiten zweier oder mehrerer Gruppen miteinander vergleichen wollen – zum Beispiel Behandlungsgruppe A vs. Behandlungsgruppe B –, kommt der Log-Rank-Test zum Einsatz. Er prüft, ob die Überlebenskurven der Gruppen statistisch signifikant voneinander abweichen.
Der Test basiert auf einem Vergleich zwischen beobachteten und erwarteten Ereigniszahlen zu jedem Ereigniszeitpunkt. Die Teststatistik folgt asymptotisch einer Chi-Quadrat-Verteilung mit einem Freiheitsgrad (bei zwei Gruppen):
Log-Rank-Teststatistik (vereinfacht)
Dabei steht für die beobachteten und für die erwarteten Ereignisse in Gruppe . Ein signifikantes Ergebnis zeigt an, dass sich die Überlebenskurven der Gruppen unterscheiden – macht aber noch keine Aussage darüber, warum dieser Unterschied besteht.
Grenzen des Log-Rank-Tests
Der Log-Rank-Test setzt voraus, dass sich die Hazard Rates der Gruppen proportional zueinander verhalten – also dass eine Gruppe konstant ein höheres oder niedrigeres Risiko hat, das Ereignis zu erleben, und sich dieses Verhältnis über die Zeit nicht umkehrt. Wenn sich die Kurven überkreuzen, verliert der Test an Aussagekraft.
Außerdem erlaubt der Test keine Adjustierung für Kovariaten. Sobald Sie Confounder kontrollieren möchten, brauchen Sie die Cox-Regression.
Schritt 3: Kovariaten modellieren mit der Cox-Regression
Das Cox-Proportional-Hazards-Modell ist das meistgenutzte multivariate Verfahren in der Überlebensanalyse. Es modelliert den Einfluss von Kovariaten auf die Hazard Rate – also auf die momentane Ereignisrate zu einem bestimmten Zeitpunkt, gegeben, dass das Ereignis bis dahin noch nicht eingetreten ist.
Cox-Modell: Hazard-Funktion
Hierbei ist die Baseline-Hazard-Funktion (die für alle Personen gleich ist und nicht geschätzt werden muss) und das Hazard Ratio für die Kovariate .
Das Hazard Ratio richtig interpretieren
Das Hazard Ratio (HR) ist das zentrale Effektmaß der Cox-Regression. Ein HR von 1,0 bedeutet: kein Unterschied zur Referenzgruppe. Ein HR von 2,0 bedeutet: das Ereignisrisiko ist zu jedem Zeitpunkt doppelt so hoch wie in der Referenzgruppe. Ein HR von 0,5 bedeutet: das Risiko ist halbiert.
Wichtig: Das Hazard Ratio ist nicht identisch mit einem Risiko- oder Odds Ratio – es bezieht sich auf die momentane Ereignisrate und nicht auf eine kumulative Wahrscheinlichkeit. Diese Verwechslung passiert in Dissertationen häufig und ist methodisch problematisch.
Proportional-Hazards-Annahme prüfen
Das Cox-Modell setzt voraus, dass das Verhältnis der Hazard Rates zwischen Gruppen über die Zeit konstant bleibt (Proportional Hazards Assumption). Diese Annahme sollte explizit geprüft werden – üblicherweise über den Schoenfeld-Residuen-Test oder grafisch über Log-Log-Plots. Ein Verstoß gegen diese Annahme macht die Ergebnisse des Modells unzuverlässig.
Einen guten Überblick über die Zusammenhänge zwischen Kaplan-Meier-Methode, Log-Rank-Test und Cox-Modell als aufeinander aufbauende Analyseschritte in klinischen Studien bietet die methodische Literatur seit Langem. Die drei Verfahren ergänzen sich: Schätzen, Vergleichen, Modellieren.
Welche statistischen Verfahren in der medizinischen Forschung am häufigsten eingesetzt werden, hängt stark von der Fragestellung ab – die Überlebensanalyse gehört jedoch zu den methodischen Kernkompetenzen, besonders in der klinischen und epidemiologischen Forschung.
Praktische Umsetzung in R
In der Praxis wird die Überlebensanalyse häufig in R mit dem Paket survival durchgeführt, das auch die Basis für das Visualisierungspaket survminer bildet. Das folgende Beispiel zeigt den vollständigen Analyseablauf für einen typischen Datensatz mit Gruppen (z. B. zwei Therapiearme).
# Pakete laden
library(survival)
library(survminer)
# Beispieldatensatz: 'zeit' = Überlebenszeit in Monaten,
# 'status' = 1 (Ereignis eingetreten) oder 0 (zensiert),
# 'gruppe' = Therapiegruppe A oder B
# Surv-Objekt erstellen
surv_objekt <- Surv(time = daten$zeit, event = daten$status)
# --- Schritt 1: Kaplan-Meier ---
km_fit <- survfit(surv_objekt ~ gruppe, data = daten)
summary(km_fit)
# Kaplan-Meier-Kurve plotten
ggsurvplot(km_fit,
data = daten,
pval = TRUE, # p-Wert des Log-Rank-Tests einblenden
conf.int = TRUE, # Konfidenzintervall anzeigen
risk.table = TRUE, # Risikotabelle unter der Kurve
legend.labs = c("Gruppe A", "Gruppe B"),
xlab = "Zeit (Monate)",
ylab = "Überlebenswahrscheinlichkeit")
# --- Schritt 2: Log-Rank-Test ---
log_rank <- survdiff(surv_objekt ~ gruppe, data = daten)
print(log_rank)
# --- Schritt 3: Cox-Regression ---
cox_modell <- coxph(surv_objekt ~ gruppe + alter + geschlecht, data = daten)
summary(cox_modell)
# Proportional-Hazards-Annahme prüfen
cox_test <- cox.zph(cox_modell)
print(cox_test)
ggcoxzph(cox_test)
Die Ausgabe von summary(cox_modell) liefert für jede Kovariate den geschätzten Koeffizienten, das Hazard Ratio (exp(coef)), das 95-%-Konfidenzintervall und den p-Wert. Das ist in der Regel genau das, was in einer Dissertation oder einem Manuskript berichtet wird.
Wer die Analyse in SPSS durchführen möchte, findet den entsprechenden Dialog unter Analysieren → Überleben → Cox-Regression bzw. für Kaplan-Meier unter Analysieren → Überleben → Kaplan-Meier. Die Logik ist identisch, die Ausgabe etwas anders strukturiert.
Typische Fehler bei der Überlebensanalyse
In medizinischen Qualifikationsarbeiten treten bei der Überlebensanalyse immer wieder dieselben methodischen Schwächen auf. Die folgende Übersicht zeigt die häufigsten Probleme und wie Sie sie vermeiden:
| Fehler | Konsequenz | Lösung |
|---|---|---|
| Zensierte Fälle ausgeschlossen | Systematischer Bias, Überschätzung des Risikos | Alle Personen im Datensatz belassen, Status = 0 vergeben |
| Startpunkt nicht eindeutig definiert | Heterogene Zeitskalen, nicht vergleichbare Kurven | Startpunkt a priori festlegen (z. B. Datum der Randomisierung) |
| PH-Annahme nicht geprüft | Ungültige Cox-Koeffizienten | Schoenfeld-Test und Log-Log-Plot durchführen |
| Hazard Ratio mit Odds Ratio verwechselt | Falsche Interpretation der Ergebnisse | HR bezieht sich auf momentane Rate, nicht auf kumulative Wahrscheinlichkeit |
| Keine Konfidenzintervalle berichtet | Unvollständige Ergebnisdarstellung | 95-%-KI für alle Hazard Ratios angeben |
Wer eine Dissertation in der Medizin plant, sollte diese Punkte bereits im statistischen Auswertungsplan berücksichtigen – idealerweise bevor die Datenerhebung beginnt. Auch die Stichprobengröße für Überlebensanalysen folgt eigenen Regeln: Sie richtet sich nicht nur nach der Fallzahl, sondern nach der erwarteten Ereigniszahl.
Zusammenfassung: Der Analyseablauf im Überblick
Eine vollständige Überlebensanalyse folgt in der medizinischen Forschung einem klaren Ablauf. Dieser lässt sich – egal ob Sie SPSS, R oder Stata verwenden – in vier Phasen gliedern:
Schritt-für-Schritt: Überlebensanalyse berechnen
- Daten vorbereiten: Zeitvariable und Ereignisvariable (0/1) definieren, Startpunkt festlegen, Zensierungslogik klären
- Kaplan-Meier-Kurven erstellen: Überlebensfunktion schätzen, Kurven grafisch darstellen, Median der Überlebenszeit ablesen
- Log-Rank-Test durchführen: Gruppenunterschiede statistisch prüfen, p-Wert und Teststatistik berichten
- Cox-Regression modellieren: Kovariaten einbeziehen, Hazard Ratios mit 95-%-KI und p-Werten berichten, PH-Annahme prüfen
Die Überlebensanalyse ist methodisch anspruchsvoller als ein einfacher Gruppenvergleich – aber sobald Sie den Unterschied zwischen Schätzen, Vergleichen und Modellieren verstanden haben, fügt sich alles zusammen. Für medizinische Studien und Qualifikationsarbeiten gehört dieses Verfahren zu den wichtigsten statistischen Werkzeugen überhaupt.
Wenn Sie unsicher sind, ob Ihre Datenstruktur die Voraussetzungen für eine Überlebensanalyse erfüllt, oder wenn Sie Unterstützung bei der Interpretation der Ergebnisse benötigen, lohnt sich die Beratung durch einen erfahrenen medizinischen Statistiker. Gerade bei Doktorarbeiten kann ein methodischer Fehler in der Planungsphase später nur schwer korrigiert werden.