Area Under the Curve (AUC)
In diesem Beitrag
Was versteht man unter Area Under the Curve (AUC)?
Die Area Under the Curve (AUC) bezeichnet die Fläche unterhalb der ROC-Kurve (Receiver Operating Characteristic). Die ROC-Kurve entsteht, indem man für ein binäres Klassifikationsmodell alle möglichen Entscheidungsschwellen durchläuft und dabei jeweils die Sensitivität (True Positive Rate) gegen die 1 – Spezifität (False Positive Rate) aufträgt.
Der AUC-Wert liegt stets zwischen 0 und 1 und gibt an, wie gut ein Modell zwischen zwei Klassen – zum Beispiel „krank“ und „gesund“ – unterscheiden kann:
- AUC = 1,0: Perfekte Trennschärfe – das Modell klassifiziert alle Fälle korrekt.
- AUC = 0,5: Kein Informationsgewinn – das Modell unterscheidet sich nicht von einem zufälligen Raten.
- AUC < 0,5: Das Modell klassifiziert schlechter als der Zufall (ein Hinweis auf invertierte Vorhersagen).
Formal entspricht die AUC der Wahrscheinlichkeit, dass ein zufällig gewähltes positives Objekt vom Modell höher bewertet wird als ein zufällig gewähltes negatives Objekt. Diese Interpretation geht auf das Wilcoxon-Mann-Whitney-Statistik-Äquivalent zurück.
Formale Definition
Warum ist AUC für statistische Analysen wichtig?
Die AUC ist ein besonders nützliches Gütemaß für Klassifikationsmodelle, weil sie unabhängig von einem bestimmten Schwellenwert ist. Viele andere Kennzahlen – etwa Genauigkeit (Accuracy) oder F1-Score – hängen davon ab, welchen konkreten Cutoff man wählt. Die AUC bewertet das Modell hingegen über alle möglichen Schwellen hinweg und liefert damit ein robusteres Gesamtbild der Diskriminierungsfähigkeit.
Ein weiterer Vorteil: Die AUC ist unempfindlich gegenüber ungleich verteilten Klassen (Class Imbalance). Wenn in einem Datensatz 95 % der Fälle zur Klasse „negativ“ gehören, kann ein Modell allein durch das pauschale Vorhersagen von „negativ“ eine hohe Accuracy erreichen – die AUC würde diesen Trick jedoch aufdecken und einen Wert nahe 0,5 liefern.
Typische Einordnung von AUC-Werten in der Praxis:
| AUC-Bereich | Interpretation |
|---|---|
| 0,90 – 1,00 | Ausgezeichnete Trennschärfe |
| 0,80 – 0,90 | Gute Trennschärfe |
| 0,70 – 0,80 | Akzeptable Trennschärfe |
| 0,60 – 0,70 | Schwache Trennschärfe |
| 0,50 – 0,60 | Keine nennenswerte Trennschärfe |
Praxisbeispiel zu AUC
Eine Medizinstudentin möchte im Rahmen ihrer Masterarbeit ein Modell zur Vorhersage von Typ-2-Diabetes evaluieren. Sie hat eine logistische Regression auf einem Datensatz mit 500 Patientinnen und Patienten trainiert (150 mit Diabetes, 350 ohne).
Nach der Modellschätzung berechnet sie die ROC-Kurve und erhält einen AUC-Wert von 0,83. Das bedeutet: In 83 % aller zufälligen Paarvergleiche – eine erkrankte Person gegen eine gesunde – weist das Modell der erkrankten Person einen höheren vorhergesagten Risikowert zu. Laut der Einordnung in Tabelle 1 entspricht das einer guten Trennschärfe.
Um zu prüfen, ob dieses Ergebnis statistisch bedeutsam ist, berechnet sie zusätzlich ein 95-%-Konfidenzintervall für die AUC (z. B. via Bootstrap oder DeLong-Methode), das von 0,78 bis 0,88 reicht. Da das Intervall deutlich oberhalb von 0,5 liegt, ist die Diskriminierungsfähigkeit des Modells statistisch gesichert.
Sie ergänzt den AUC-Befund anschließend durch eine Analyse der Sensitivität und Spezifität bei einem klinisch sinnvollen Schwellenwert – denn für die praktische Anwendung muss am Ende ein konkreter Cutoff gewählt werden.