Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress
Statistik-Ratgeber

Welche Methoden gibt es zur Interpretation von Testergebnissen?

Verschriftlichung / Ergebnisinterpretation · Maximilian Fuchs · 20. Mai 2026 · 9 Min. Lesezeit

Überblick: Drei Kernmethoden der Testergebnisinterpretation

Zur Interpretation statistischer Testergebnisse stehen drei methodische Ansätze zur Verfügung: die p-Wert-Interpretation, die Effektstärkenanalyse und die Auswertung von Konfidenzintervallen. Alle drei liefern unterschiedliche Informationen – und erst in Kombination ergibt sich ein vollständiges Bild.

In der Praxis empirischer Abschlussarbeiten wird häufig nur der p-Wert berichtet. Das ist methodisch unvollständig und entspricht nicht mehr dem aktuellen wissenschaftlichen Standard. Wer seine Ergebnisse sauber interpretieren will, braucht alle drei Perspektiven.

Gut zu wissen Die professionelle Interpretation und Verschriftlichung statistischer Ergebnisse umfasst immer mehr als nur das Ablesen des p-Werts. Signifikanz, Effektstärke und Präzision der Schätzung ergänzen sich gegenseitig.

Methode 1: Der p-Wert und seine Grenzen

Was der p-Wert aussagt

Der p-Wert gibt an, wie wahrscheinlich es ist, unter Gültigkeit der Nullhypothese ein mindestens so extremes Ergebnis zu erhalten wie das tatsächlich beobachtete. Ein Signifikanzniveau von 0,05 bedeutet: Beträgt der p-Wert weniger als 0,05, wird die Nullhypothese verworfen – das Ergebnis gilt als statistisch signifikant.

In der Methodenliteratur wird jedoch nachdrücklich darauf hingewiesen, dass ein p-Wert weder die Größe eines Unterschieds noch seine praktische oder inhaltliche Bedeutung beschreibt. Die Grenze von p < 0,05 ist historisch-konventionell gewählt, nicht inhaltlich zwingend.

Was der p-Wert nicht aussagt

Drei Missverständnisse treten besonders häufig auf:

  • Ein signifikantes Ergebnis ist kein Beleg für praktische Relevanz – bei sehr großen Stichproben werden auch winzige, inhaltlich bedeutungslose Unterschiede signifikant.
  • Ein nicht-signifikantes Ergebnis bedeutet nicht, dass kein Effekt existiert – es kann auch an mangelnder Teststärke liegen.
  • Der p-Wert sagt nichts über die Richtung oder Größe des Effekts aus.

Die Frage, ob ein bestimmter p-Wert als signifikant einzustufen ist, hängt zudem vom gewählten Signifikanzniveau ab. Ob 0,01 oder 0,05 als Schwelle sinnvoller ist, sollte vorab begründet und nicht nachträglich angepasst werden.

Häufiger Fehler Viele Studierende schreiben: „Das Ergebnis ist signifikant, also ist der Effekt bedeutsam.“ Das ist eine Überinterpretation. Statistische Signifikanz und praktische Bedeutsamkeit sind zwei verschiedene Aussagen, die getrennt bewertet werden müssen.

Methode 2: Effektstärken – Was die Größe eines Befundes verrät

Warum Effektstärken unverzichtbar sind

Effektstärken quantifizieren, wie groß ein beobachteter Unterschied oder Zusammenhang ist – unabhängig von der Stichprobengröße. Damit liefern sie das, was der p-Wert nicht leisten kann: eine Aussage über die inhaltliche Bedeutsamkeit eines Befunds.

In der Fachliteratur wird empfohlen, Effektstärken grundsätzlich neben dem p-Wert zu berichten, weil sie für Power-Analysen, Stichprobenplanung, den Vergleich zwischen Studien und Meta-Analysen benötigt werden.

d-Familie vs. r-Familie

Die Wahl der passenden Effektstärke hängt vom Studiendesign ab. Grundsätzlich unterscheidet man zwei Familien:

Übersicht: Gängige Effektstärkemaße nach Anwendungsfall
Effektstärkemaß Familie Typischer Anwendungsfall Richtwerte (klein / mittel / groß)
Cohens d d-Familie t-Test (unabhängige Gruppen) 0,20 / 0,50 / 0,80
Hedges‘ g d-Familie t-Test (kleine Stichproben) 0,20 / 0,50 / 0,80
Eta-Quadrat (η²) r-Familie ANOVA (erklärte Varianz) 0,01 / 0,06 / 0,14
Partielles η² r-Familie Mehrfaktorielle ANOVA 0,01 / 0,06 / 0,14
Pearson r r-Familie Korrelation 0,10 / 0,30 / 0,50
Cohens r-Familie Regressionsanalyse 0,02 / 0,15 / 0,35

Richtwerte kontextuell einordnen

Die pauschalen Schwellenwerte für „klein“, „mittel“ und „groß“ sind Orientierungshilfen – keine Absolutmaßstäbe. Ob ein Effekt von d = 0,30 in einer Studie relevant ist, hängt vom Forschungsfeld, der Messskala und der praktischen Bedeutung ab. In der klinischen Forschung kann ein kleiner Effekt bei einer schwerwiegenden Erkrankung durchaus entscheidend sein.

Cohens d: Standardisierter Mittelwertsunterschied

Wichtig: Bei Messwiederholungsdesigns liefern dieselben Formeln andere Werte als bei unabhängigen Gruppen – die Designwahl bestimmt also, welche Effektstärke berechnet und interpretiert werden sollte. Wer unsicher ist, welches Maß in seiner Arbeit angemessen ist, findet in unserem Beitrag zur Interpretation statistischer Ergebnisse eine methodische Entscheidungshilfe.

Methode 3: Konfidenzintervalle – Präzision statt Schwellenwert

Was ein Konfidenzintervall zeigt

Ein Konfidenzintervall (KI) gibt einen Wertebereich an, der den wahren Populationsparameter mit einer bestimmten Wahrscheinlichkeit – meist 95 % – enthält. Es beantwortet nicht nur die Frage, ob ein Effekt vorliegt, sondern auch: Welche Effektgrößen sind mit den Daten plausibel vereinbar?

In der Methodenliteratur wird betont, dass ein enges Konfidenzintervall für hohe Präzision der Schätzung spricht, während ein breites Intervall größere Unsicherheit signalisiert. Das macht Konfidenzintervalle zu einem direkten Maß für die Informationsqualität Ihrer Daten.

Interpretation anhand des smallest worthwhile effect

Ein besonders nützlicher Ansatz besteht darin, das Konfidenzintervall gegen den smallest worthwhile effect zu lesen – also die kleinste Wirkung, die noch als praktisch bedeutsam gilt. Dabei ergeben sich vier Szenarien:

  • Das gesamte KI liegt oberhalb des smallest worthwhile effect → klare Evidenz für einen praktisch relevanten Effekt.
  • Das gesamte KI liegt unterhalb des smallest worthwhile effect → Evidenz gegen praktische Relevanz.
  • Das KI schließt den Nullwert ein, aber auch Werte oberhalb der Relevanzschwelle → Ergebnis bleibt uneindeutig, mehr Daten nötig.
  • Das KI ist sehr eng um den Nullwert → gute Evidenz für das Fehlen eines relevanten Effekts.

Dieser Ansatz überwindet die künstliche Dichotomie des Null-Hypothesen-Signifikanztests: Statt „signifikant oder nicht“ fragt man, welche Effektgrößen die Daten noch stützen. Das ist besonders hilfreich beim Interpretieren von Daten in Bachelorarbeiten und Dissertationen, wo inhaltliche Schlussfolgerungen gefragt sind.

Methoden kombinieren: So entsteht eine vollständige Interpretation

Die empfohlene Reihenfolge

Eine methodisch vollständige Interpretation von Testergebnissen folgt einer klaren Struktur. In der Methodenliteratur wird empfohlen, für jeden Test folgende Angaben zu machen:

Checkliste: Vollständige Ergebnisberichterstattung

  • Hypothese und getestete Nullhypothese benennen
  • Verwendeten Test und geprüfte Voraussetzungen nennen
  • Teststatistik mit Freiheitsgraden angeben (z. B. t(48) = 2,34)
  • p-Wert berichten – ohne dichotome Überinterpretation
  • Effektstärke berechnen und mit Richtwerten einordnen
  • Konfidenzintervall angeben und inhaltlich kommentieren
  • Befund in die Forschungsliteratur einbetten

Ein konkretes Beispiel

Angenommen, Sie vergleichen die Prüfungsleistungen zweier Lerngruppen per unabhängigem t-Test. Eine vollständige Interpretation könnte so aussehen:

„Gruppe A (M = 72,4, SD = 8,1) erzielte signifikant höhere Leistungen als Gruppe B (M = 67,9, SD = 9,3), t(98) = 2,61, p = .011. Die Effektstärke war klein bis mittel (d = 0,52, 95%-KI [0,12; 0,92]). Das Konfidenzintervall schließt Werte ein, die über der vorab definierten Relevanzschwelle von d = 0,20 liegen, was auf einen praktisch bedeutsamen Unterschied hindeutet.“

Beachten Sie: Diese drei Sätze liefern gemeinsam weit mehr Information als ein bloßes „p < 0,05″. Wie Sie solche Formulierungen systematisch entwickeln, zeigt unser Beitrag zum Formulieren von Interpretationen.

Wer außerdem wissen möchte, wie der Ergebnisteil einer wissenschaftlichen Arbeit aufgebaut wird, findet in unserem Leitfaden zum Formulieren statistischer Ergebnisse eine strukturierte Orientierung.

Häufige Fehler bei der Interpretation von Testergebnissen

Signifikanz mit Wichtigkeit gleichsetzen

Der häufigste Fehler in empirischen Abschlussarbeiten: Ein signifikanter p-Wert wird automatisch als Beleg für einen wichtigen oder starken Effekt gewertet. Dabei hängt der p-Wert direkt von der Stichprobengröße ab – je mehr Fälle, desto eher wird auch ein winziger Unterschied signifikant. Die inhaltliche Bewertung erfolgt ausschließlich über Effektstärke und Konfidenzintervall.

Grenzwertige p-Werte falsch einordnen

Was tun, wenn p = 0,051 oder p = 0,055? Solche Ergebnisse werden häufig entweder voreilig als „knapp nicht signifikant“ abgetan oder unter Verweis auf Rundungsfehler doch als signifikant bewertet. Die korrekte Vorgehensweise: Berichten Sie den genauen Wert, kommentieren Sie die Unsicherheit und stützen Sie Ihre inhaltliche Schlussfolgerung auf die Effektstärke und das Konfidenzintervall. Ausführlicher dazu finden Sie in unseren Beiträgen zu p = 0,055 und p = 0,051.

Effektstärken ohne Kontextbezug interpretieren

Cohens Richtwerte (klein, mittel, groß) wurden ursprünglich als Faustregeln für Felder entwickelt, in denen keine besseren Vergleichswerte existieren. In etablierten Forschungsfeldern sollten Effektstärken stets gegen publizierte Meta-Analysen oder ähnliche Studien eingeordnet werden – nicht nur gegen abstrakte Schwellenwerte.

Konfidenzintervalle ignorieren

Viele Studierende berichten ein Konfidenzintervall, kommentieren es aber nicht inhaltlich. Ein KI, das sowohl kleine als auch sehr große Effekte einschließt, ist ein Hinweis auf geringe Teststärke – das sollte in der Diskussion thematisiert werden. Wie Sie dabei systematisch vorgehen, zeigt unser Beitrag zum Interpretieren statistischer Ergebnisse.

Einfach erklärt Stellen Sie sich die drei Methoden als Lupe, Lineal und Toleranzrahmen vor: Der p-Wert zeigt Ihnen, ob etwas „da“ ist. Die Effektstärke misst, wie groß es ist. Das Konfidenzintervall zeigt, wie präzise diese Messung ist und welche anderen Werte noch plausibel wären.
Testergebnisse interpretieren p-Wert Effektstärke Konfidenzintervall Cohens d Signifikanz Ergebnisinterpretation Abschlussarbeit

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!