Cohen’s Kappa
In diesem Beitrag
Was versteht man unter Cohen’s Kappa?
Cohen’s Kappa (κ) ist ein Maß für die Übereinstimmung zwischen zwei Beurteilenden (Ratern), das die zufällig zu erwartende Übereinstimmung herausrechnet. Es wurde 1960 von Jacob Cohen entwickelt und kommt immer dann zum Einsatz, wenn zwei Personen oder zwei Messverfahren dieselben Objekte in kategoriale Klassen einteilen – und man wissen möchte, wie verlässlich sie dabei übereinstimmen.
Die Formel lautet:
Formel: Cohen’s Kappa
Dabei steht für die beobachtete Übereinstimmungsrate und für die Übereinstimmungsrate, die rein zufällig zu erwarten wäre. Der Nenner normiert das Ergebnis auf den maximal möglichen Wert über den Zufall hinaus.
κ kann Werte zwischen −1 und +1 annehmen. Ein Wert von 1 bedeutet vollständige Übereinstimmung, ein Wert von 0 entspricht reiner Zufallsübereinstimmung, und negative Werte deuten auf eine systematisch schlechtere Übereinstimmung hin als der Zufall erwarten ließe.
Als grobe Orientierung für die Interpretation hat sich folgende Einteilung etabliert:
| κ-Wert | Interpretation |
|---|---|
| < 0,00 | Keine Übereinstimmung |
| 0,00 – 0,20 | Schwache Übereinstimmung |
| 0,21 – 0,40 | Ausreichende Übereinstimmung |
| 0,41 – 0,60 | Moderate Übereinstimmung |
| 0,61 – 0,80 | Gute Übereinstimmung |
| 0,81 – 1,00 | Sehr gute / nahezu perfekte Übereinstimmung |
Warum ist Cohen’s Kappa für statistische Analysen wichtig?
In vielen Forschungsbereichen – von der Medizin über die Psychologie bis zur qualitativen Inhaltsanalyse – werden Daten durch menschliche Urteile erhoben. Das können Diagnosen, Kodierungen von Interviewaussagen, Bewertungen von Texten oder Beobachtungsprotokolle sein. Damit solche Daten als verlässlich gelten können, muss nachgewiesen werden, dass verschiedene Beurteilende zu denselben Ergebnissen kommen. Genau das misst Cohen’s Kappa: die Interrater-Reliabilität.
Der entscheidende Vorteil gegenüber der einfachen prozentualen Übereinstimmung ist die Korrektur für Zufall. Wenn beispielsweise zwei Kodierende ein Merkmal in 90 % der Fälle einer von nur zwei Kategorien zuordnen, ist auch eine zufällige Übereinstimmung sehr hoch – die bloße Übereinstimmungsrate würde die tatsächliche Reliabilität dann überschätzen. Cohen’s Kappa bereinigt diesen Effekt.
Praxisbeispiel zu Cohen’s Kappa
Zwei Psychologinnen kodieren 50 Interviewaussagen unabhängig voneinander als entweder „positiv“ oder „negativ“. Das Ergebnis sieht so aus:
| Raterin B: positiv | Raterin B: negativ | Summe | |
|---|---|---|---|
| Raterin A: positiv | 20 | 5 | 25 |
| Raterin A: negativ | 3 | 22 | 25 |
| Summe | 23 | 27 | 50 |
Die beobachtete Übereinstimmung berechnet sich aus den Fällen, in denen beide Raterinnen übereinstimmen (20 + 22 = 42 von 50):
Beobachtete Übereinstimmung
Die zufällig erwartete Übereinstimmung ergibt sich aus den Randhäufigkeiten: Für „positiv“ wäre sie , für „negativ“ . Zusammen ergibt das .
Cohen’s Kappa berechnet sich dann als:
Berechnung von κ
Ein κ von 0,68 entspricht nach der Landis-&-Koch-Skala einer guten Übereinstimmung. Die beiden Psychologinnen stimmen also deutlich besser überein, als es der Zufall erwarten ließe – die Kodierung kann als hinreichend reliabel eingestuft werden.