Zensierung
In diesem Beitrag
Was versteht man unter Zensierung?
Zensierung bezeichnet in der Statistik eine besondere Form unvollständiger Beobachtungen: Der genaue Wert einer Messgröße – typischerweise eine Überlebens- oder Ereigniszeit – ist nicht bekannt, weil das interessierende Ereignis während des Beobachtungszeitraums nicht eingetreten ist oder die Beobachtung aus anderen Gründen vorzeitig endet. Man weiß also, dass das Ereignis irgendwann nach dem Beobachtungsende stattfindet, aber nicht wann.
In der Überlebenszeitanalyse (Survival Analysis) unterscheidet man drei grundlegende Arten der Zensierung:
- Rechtszensierung (right censoring): Die häufigste Form. Das Ereignis ist bis zum Ende des Beobachtungszeitraums noch nicht eingetreten. Man weiß nur, dass die Ereigniszeit größer ist als die beobachtete Zeit. Beispiel: Ein Patient lebt noch am Ende der Studie.
- Linkszensierung (left censoring): Das Ereignis ist bereits eingetreten, bevor die Beobachtung beginnt. Der genaue Zeitpunkt liegt also vor dem ersten Messzeitpunkt.
- Intervallzensierung (interval censoring): Man weiß nur, dass das Ereignis in einem bestimmten Zeitintervall stattgefunden hat, nicht aber zum genauen Zeitpunkt.
Formal gilt bei Rechtszensierung: Statt der wahren Ereigniszeit beobachtet man nur den zensierten Wert sowie einen Indikator , der anzeigt, ob das Ereignis eingetreten ist (1) oder die Beobachtung zensiert wurde (0).
Warum ist Zensierung für statistische Analysen wichtig?
Zensierte Daten entstehen in der Praxis fast zwangsläufig, sobald man Ereigniszeiten untersucht – etwa in der Medizin, der Ingenieurwissenschaft oder der Sozialforschung. Das Problem: Würde man zensierte Beobachtungen einfach weglassen oder naiv behandeln, entstehen verzerrte Schätzungen.
Klassische Methoden wie Mittelwerte oder lineare Regressionen sind für zensierte Daten ungeeignet, weil sie die Informationen aus zensierten Beobachtungen ignorieren oder falsch einbeziehen. Stattdessen kommen speziell entwickelte Verfahren zum Einsatz:
- Kaplan-Meier-Schätzer: Schätzt die Überlebensfunktion nicht-parametrisch unter Berücksichtigung zensierter Beobachtungen.
- Cox-Regressionsmodell: Untersucht den Einfluss von Kovariablen auf die Hazardrate und kann mit zensierten Daten umgehen.
- Parametrische Überlebenszeitmodelle: Nehmen eine bestimmte Verteilungsform an (z.B. Weibull oder Exponentialverteilung) und schätzen deren Parameter unter Einbeziehung zensierter Daten.
Praxisbeispiel zu Zensierung
In einer klinischen Studie wird untersucht, wie lange Patienten nach einer Krebsdiagnose ohne Rückfall bleiben (rezidivfreies Überleben). Die Studie läuft über 36 Monate. Für fünf Patienten ergeben sich folgende Beobachtungen:
| Patient | Beobachtete Zeit (Monate) | Ereignis eingetreten? | Interpretation |
|---|---|---|---|
| 1 | 12 | Ja | Rückfall nach 12 Monaten – vollständige Beobachtung |
| 2 | 36 | Nein | Kein Rückfall bis Studienende – rechtszensiert |
| 3 | 20 | Ja | Rückfall nach 20 Monaten – vollständige Beobachtung |
| 4 | 18 | Nein | Patient verzogen nach 18 Monaten – rechtszensiert |
| 5 | 30 | Nein | Kein Rückfall bis Studienende – rechtszensiert |
Patient 2, 4 und 5 sind zensiert. Ihre genaue Rückfallzeit ist unbekannt – man weiß nur, dass sie mindestens so lange rückfallfrei waren wie angegeben. Ein Kaplan-Meier-Schätzer würde diese Informationen korrekt einbeziehen, anstatt die drei Patienten auszuschließen oder deren Beobachtungszeit als Rückfallzeitpunkt zu werten.