Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Interrater-Reliabilität

Interrater Reliability / Beurteilerübereinstimmung · Maximilian Fuchs · 24. April 2026 · 5 Min. Lesezeit

Was versteht man unter Interrater-Reliabilität?

Die Interrater-Reliabilität (auch: Beurteilerübereinstimmung) ist ein Maß dafür, wie stark verschiedene Personen – sogenannte Rater oder Beurteiler – bei der Einschätzung desselben Sachverhalts übereinstimmen. Sie ist ein zentrales Gütekriterium in der empirischen Forschung, besonders wenn Merkmale nicht objektiv gemessen, sondern von Menschen bewertet oder kodiert werden.

Typische Kennwerte zur Berechnung der Interrater-Reliabilität sind:

  • Cohens Kappa (κ): Der bekannteste Koeffizient für kategoriale Daten. Er berücksichtigt, wie viel Übereinstimmung zufällig zu erwarten wäre, und korrigiert darum.
  • Intraklassen-Korrelationskoeffizient (ICC): Wird bei metrischen Daten eingesetzt, wenn mehrere Rater numerische Werte vergeben.
  • Prozentuale Übereinstimmung: Der einfachste Ansatz – Anteil der Fälle, bei denen alle Rater gleich urteilen. Hat jedoch den Nachteil, zufällige Übereinstimmungen nicht herauszurechnen.

Cohens Kappa berechnet sich nach der Formel:

Cohens Kappa

Dabei steht für die tatsächlich beobachtete Übereinstimmung und für die zufällig erwartete Übereinstimmung. Ein Kappa von 1 bedeutet perfekte Übereinstimmung, ein Wert von 0 entspricht reinem Zufall.

Einfach erklärt: Stell dir vor, zwei Lehrerinnen bewerten unabhängig voneinander dieselben Aufsätze. Die Interrater-Reliabilität sagt dir, wie ähnlich ihre Noten ausfallen – und ob diese Ähnlichkeit wirklich auf ihrer Beurteilung beruht oder einfach Zufall ist.

Warum ist Interrater-Reliabilität für statistische Analysen wichtig?

Immer wenn Daten nicht automatisch gemessen, sondern von Menschen eingeschätzt werden – etwa bei der Kodierung von Interviewantworten, der Bewertung von Verhaltensbeobachtungen oder der Diagnose klinischer Merkmale – stellt sich die Frage: Hängen die Ergebnisse vom jeweiligen Beurteiler ab? Wenn ja, sind die Daten nicht vertrauenswürdig, weil sie systematisch durch die Person der Beurteilerin oder des Beurteilers verzerrt werden.

Eine hohe Interrater-Reliabilität zeigt, dass das Messinstrument und das Kodierschema so eindeutig sind, dass verschiedene Personen zu denselben Ergebnissen kommen. Das ist eine Grundvoraussetzung für Objektivität – einem der drei klassischen Hauptgütekriterien (neben Reliabilität und Validität).

Als Faustregel für die Interpretation von Cohens Kappa gilt:

Tabelle 1. Bewertungsrichtlinie für Cohens Kappa nach Landis & Koch (1977)
Kappa-Wert Interpretation
< 0,00 Keine Übereinstimmung
0,00 – 0,20 Schwache Übereinstimmung
0,21 – 0,40 Mäßige Übereinstimmung
0,41 – 0,60 Moderate Übereinstimmung
0,61 – 0,80 Gute Übereinstimmung
0,81 – 1,00 Sehr gute Übereinstimmung
Häufiger Fehler: Viele Studierende verwenden nur die prozentuale Übereinstimmung als Maß. Diese kann jedoch täuschen: Wenn beispielsweise 90 % aller Fälle in eine Kategorie fallen, würden zwei Rater allein durch Zufall schon in etwa 81 % der Fälle übereinstimmen – ohne wirklich dasselbe zu beurteilen. Cohens Kappa korrigiert genau diesen Effekt.
Gut zu wissen: In vielen Fachzeitschriften und Qualifikationsarbeiten wird ein Kappa-Wert von mindestens κ = 0,70 als Mindestanforderung für eine akzeptable Interrater-Reliabilität gefordert. Einige Felder, wie die klinische Diagnostik, setzen die Messlatte noch höher.

Praxisbeispiel zu Interrater-Reliabilität

Eine Psychologiestudentin untersucht in ihrer Masterarbeit, wie häufig Jugendliche in Schulpausen prosoziales Verhalten zeigen. Zwei geschulte Beobachter kodieren unabhängig voneinander 50 Videosequenzen und entscheiden jeweils: „prosoziales Verhalten vorhanden“ (ja/nein).

Die Auswertung ergibt folgendes Bild:

Tabelle 2. Übereinstimmungsmatrix der beiden Rater (n = 50 Sequenzen)
Rater 2: Ja Rater 2: Nein
Rater 1: Ja 20 4
Rater 1: Nein 3 23

Die beobachtete Übereinstimmung beträgt , also 86 %. Nach Berechnung der zufällig erwarteten Übereinstimmung ergibt sich ein Cohens Kappa von κ ≈ 0,72. Das entspricht nach den gängigen Richtwerten einer guten Übereinstimmung – die Kodierung gilt damit als hinreichend objektiv und die erhobenen Daten als auswertbar.

Hätte die Studentin nur die prozentuale Übereinstimmung (86 %) berichtet, wäre nicht erkennbar gewesen, wie viel davon dem Zufall geschuldet ist. Der Kappa-Wert liefert hier das deutlich aussagekräftigere Bild.

Reliabilität Cohens Kappa ICC Gütekriterien Objektivität Beobachtungsstudie Qualitative Inhaltsanalyse

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!