Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Teststärke

Statistical Power / Power eines Tests · Maximilian Fuchs · 24. April 2026 · 5 Min. Lesezeit

Was versteht man unter Teststärke?

Die Teststärke (englisch: statistical power) eines Hypothesentests ist die Wahrscheinlichkeit, einen tatsächlich vorhandenen Effekt auch statistisch zu entdecken – also die Nullhypothese korrekt abzulehnen, wenn sie falsch ist. Formal gilt:

Definition

Dabei steht β für die Wahrscheinlichkeit eines Fehlers 2. Art (Beta-Fehler): die Nullhypothese fälschlicherweise beizubehalten, obwohl ein Effekt vorliegt. Die Teststärke ist also das Gegenstück zu β.

Die Teststärke wird beeinflusst von vier zentralen Faktoren:

  • Stichprobengröße (n): Größere Stichproben erhöhen die Teststärke.
  • Effektgröße: Stärkere Effekte sind leichter nachzuweisen.
  • Signifikanzniveau (α): Ein höheres α (z. B. 0,10 statt 0,05) erhöht die Teststärke, aber auch das Fehlerrisiko 1. Art.
  • Streuung der Daten: Geringere Varianz erleichtert den Nachweis von Effekten.
Einfach erklärt Stell dir vor, du suchst mit einer Taschenlampe nach einem verlorenen Schlüssel im Dunkeln. Die Teststärke beschreibt, wie hell deine Lampe ist. Eine schwache Lampe (geringe Power) übersieht den Schlüssel leicht, selbst wenn er direkt vor dir liegt. Eine starke Lampe (hohe Power) findet ihn zuverlässig. Kurz: Hohe Teststärke bedeutet, dass dein Test empfindlich genug ist, um echte Effekte auch wirklich zu erkennen.

Warum ist Teststärke für statistische Analysen wichtig?

In der Praxis wird die Teststärke oft unterschätzt oder schlicht ignoriert – mit teils gravierenden Folgen. Studien mit zu geringer Power übersehen echte Effekte, was zu falschen Schlussfolgerungen führt. Gleichzeitig sind Ergebnisse aus schwach gepowerten Studien weniger verlässlich: Selbst wenn ein statistisch signifikantes Ergebnis erzielt wird, ist die Wahrscheinlichkeit hoch, dass es zufallsbedingt ist (sogenanntes Winner’s Curse-Phänomen).

In der Wissenschaft gilt eine Teststärke von mindestens 0,80 (80 %) als angestrebter Mindestwert. Das bedeutet: Bei 100 unabhängigen Replikationen einer Studie würde man in mindestens 80 Fällen einen tatsächlich vorhandenen Effekt korrekt entdecken.

Besonders relevant ist die Teststärke bei der Stichprobenplanung: Vor einer Studie lässt sich mit einer A-priori-Poweranalyse berechnen, wie groß die Stichprobe sein muss, um eine gewünschte Teststärke zu erreichen. Viele Ethikkommissionen, Fördergeber und Fachzeitschriften fordern diesen Nachweis inzwischen explizit.

Häufiger Fehler Viele Forschende führen die Poweranalyse erst nach der Datenerhebung durch (Post-hoc-Poweranalyse) und interpretieren die berechnete Power als Qualitätsmerkmal ihres Ergebnisses. Das ist irreführend: Die nachträgliche Power hängt direkt vom beobachteten p-Wert ab und liefert keine eigenständige Information. Eine Poweranalyse gehört in die Planungsphase einer Studie.

Praxisbeispiel zu Teststärke

Eine Psychologiestudentin plant eine Studie, die untersucht, ob ein neues Entspannungstraining den wahrgenommenen Stress bei Studierenden senkt. Sie erwartet auf Basis der Literatur einen mittleren Effekt (Cohen’s d = 0,50) und legt das Signifikanzniveau auf α = 0,05 fest. Sie möchte eine Teststärke von 0,80 erreichen.

Mit einem Programm wie G*Power berechnet sie: Für einen einseitigen t-Test für unabhängige Stichproben bei diesen Parametern benötigt sie ca. 51 Personen pro Gruppe, also insgesamt etwa 102 Teilnehmende.

Tabelle 1. Einfluss der Stichprobengröße auf die Teststärke (α = 0,05, d = 0,50, zweiseitiger t-Test)
n pro Gruppe Teststärke (Power) Bewertung
20 0,34 Zu gering – hohes Risiko, den Effekt zu verpassen
51 0,80 Empfohlenes Minimum
80 0,93 Gut – robustere Absicherung
130 0,99 Sehr hoch – für kritische Entscheidungen sinnvoll

Das Beispiel zeigt deutlich: Wer mit nur 20 Personen pro Gruppe testet, hat selbst bei einem echten mittleren Effekt nur eine 34-prozentige Chance, diesen zu entdecken. Zwei von drei Studien würden den Effekt in diesem Fall schlicht übersehen – nicht weil er nicht existiert, sondern weil die Studie zu wenig Power hatte.

Gut zu wissen Kostenlose Tools zur Poweranalyse: G*Power (für viele gängige Tests), das R-Paket pwr sowie webbasierte Rechner wie statmethods.net. Viele Beratungsstellen für wissenschaftliches Arbeiten helfen auch bei der Berechnung der benötigten Stichprobengröße.

Teststärke Power Hypothesentest Fehler 2. Art Stichprobengröße Poweranalyse Effektgröße Signifikanzniveau

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!