Interrater-Reliabilität
In diesem Beitrag
Was versteht man unter Interrater-Reliabilität?
Die Interrater-Reliabilität (auch: Beurteilerübereinstimmung) ist ein Maß dafür, wie stark verschiedene Personen – sogenannte Rater oder Beurteiler – bei der Einschätzung desselben Sachverhalts übereinstimmen. Sie ist ein zentrales Gütekriterium in der empirischen Forschung, besonders wenn Merkmale nicht objektiv gemessen, sondern von Menschen bewertet oder kodiert werden.
Typische Kennwerte zur Berechnung der Interrater-Reliabilität sind:
- Cohens Kappa (κ): Der bekannteste Koeffizient für kategoriale Daten. Er berücksichtigt, wie viel Übereinstimmung zufällig zu erwarten wäre, und korrigiert darum.
- Intraklassen-Korrelationskoeffizient (ICC): Wird bei metrischen Daten eingesetzt, wenn mehrere Rater numerische Werte vergeben.
- Prozentuale Übereinstimmung: Der einfachste Ansatz – Anteil der Fälle, bei denen alle Rater gleich urteilen. Hat jedoch den Nachteil, zufällige Übereinstimmungen nicht herauszurechnen.
Cohens Kappa berechnet sich nach der Formel:
Cohens Kappa
Dabei steht für die tatsächlich beobachtete Übereinstimmung und für die zufällig erwartete Übereinstimmung. Ein Kappa von 1 bedeutet perfekte Übereinstimmung, ein Wert von 0 entspricht reinem Zufall.
Warum ist Interrater-Reliabilität für statistische Analysen wichtig?
Immer wenn Daten nicht automatisch gemessen, sondern von Menschen eingeschätzt werden – etwa bei der Kodierung von Interviewantworten, der Bewertung von Verhaltensbeobachtungen oder der Diagnose klinischer Merkmale – stellt sich die Frage: Hängen die Ergebnisse vom jeweiligen Beurteiler ab? Wenn ja, sind die Daten nicht vertrauenswürdig, weil sie systematisch durch die Person der Beurteilerin oder des Beurteilers verzerrt werden.
Eine hohe Interrater-Reliabilität zeigt, dass das Messinstrument und das Kodierschema so eindeutig sind, dass verschiedene Personen zu denselben Ergebnissen kommen. Das ist eine Grundvoraussetzung für Objektivität – einem der drei klassischen Hauptgütekriterien (neben Reliabilität und Validität).
Als Faustregel für die Interpretation von Cohens Kappa gilt:
| Kappa-Wert | Interpretation |
|---|---|
| < 0,00 | Keine Übereinstimmung |
| 0,00 – 0,20 | Schwache Übereinstimmung |
| 0,21 – 0,40 | Mäßige Übereinstimmung |
| 0,41 – 0,60 | Moderate Übereinstimmung |
| 0,61 – 0,80 | Gute Übereinstimmung |
| 0,81 – 1,00 | Sehr gute Übereinstimmung |
Praxisbeispiel zu Interrater-Reliabilität
Eine Psychologiestudentin untersucht in ihrer Masterarbeit, wie häufig Jugendliche in Schulpausen prosoziales Verhalten zeigen. Zwei geschulte Beobachter kodieren unabhängig voneinander 50 Videosequenzen und entscheiden jeweils: „prosoziales Verhalten vorhanden“ (ja/nein).
Die Auswertung ergibt folgendes Bild:
| Rater 2: Ja | Rater 2: Nein | |
|---|---|---|
| Rater 1: Ja | 20 | 4 |
| Rater 1: Nein | 3 | 23 |
Die beobachtete Übereinstimmung beträgt , also 86 %. Nach Berechnung der zufällig erwarteten Übereinstimmung ergibt sich ein Cohens Kappa von κ ≈ 0,72. Das entspricht nach den gängigen Richtwerten einer guten Übereinstimmung – die Kodierung gilt damit als hinreichend objektiv und die erhobenen Daten als auswertbar.
Hätte die Studentin nur die prozentuale Übereinstimmung (86 %) berichtet, wäre nicht erkennbar gewesen, wie viel davon dem Zufall geschuldet ist. Der Kappa-Wert liefert hier das deutlich aussagekräftigere Bild.