Bonferroni-adjustierter p-Wert
In diesem Beitrag
Was versteht man unter dem Bonferroni-adjustierten p-Wert?
Wenn in einer Studie nicht nur ein einzelner statistischer Test, sondern mehrere Tests gleichzeitig durchgeführt werden, steigt die Wahrscheinlichkeit, rein zufällig ein signifikantes Ergebnis zu erhalten – auch wenn in Wirklichkeit kein Effekt existiert. Dieses Problem wird als multiples Testen bezeichnet.
Die Bonferroni-Korrektur ist eine der einfachsten und bekanntesten Methoden, um dieses Problem zu kontrollieren. Das Prinzip: Das gewählte Signifikanzniveau wird durch die Anzahl der durchgeführten Tests geteilt. Ein Einzeltest gilt dann nur noch als signifikant, wenn sein p-Wert das korrigierte Niveau unterschreitet:
Bonferroni-Korrektur
Der Bonferroni-adjustierte p-Wert ist dabei die rechnerische Kehrseite: Statt das Signifikanzniveau zu senken, wird der ursprüngliche p-Wert des einzelnen Tests mit der Anzahl der Tests multipliziert und dann mit dem ursprünglichen Niveau verglichen:
Bonferroni-adjustierter p-Wert
Der adjustierte p-Wert wird dabei auf maximal 1 begrenzt, da ein p-Wert per Definition nicht größer als 1 sein kann. Beide Formulierungen – korrigiertes Niveau oder adjustierter p-Wert – führen zu identischen Entscheidungen.
Warum ist der Bonferroni-adjustierte p-Wert für statistische Analysen wichtig?
In vielen Forschungsfeldern – etwa in der Medizin, Psychologie oder den Sozialwissenschaften – werden Studien mit mehreren abhängigen Variablen oder mehreren Gruppenvergleichen durchgeführt. Ohne eine Korrektur für multiples Testen steigt die sogenannte familywise error rate (FWER), also die Wahrscheinlichkeit, mindestens einen fälschlichen Befund (Fehler 1. Art) zu produzieren, erheblich an. Bei 20 unabhängigen Tests mit ist diese Wahrscheinlichkeit bereits rund 64 %.
Die Bonferroni-Korrektur kontrolliert die FWER und stellt sicher, dass die Gesamtwahrscheinlichkeit für einen solchen Fehler das ursprüngliche Signifikanzniveau nicht überschreitet. Das macht Ergebnisse zuverlässiger und schützt vor falschen Schlussfolgerungen.
Praxisbeispiel zu Bonferroni-adjustierter p-Wert
Eine Psychologin untersucht, ob ein neues Training die Leistung von Studierenden verbessert. Sie misst vier verschiedene Outcomes: Konzentration, Gedächtnisleistung, Reaktionszeit und Stressniveau. Das bedeutet: Sie führt vier unabhängige t-Tests durch und legt ein Signifikanzniveau von fest.
Nach der Bonferroni-Korrektur muss jeder einzelne Test das korrigierte Niveau unterschreiten:
Korrigiertes Signifikanzniveau
Die Ergebnisse der vier Tests lauten:
| Outcome | Roh-p-Wert | Adjustierter p-Wert (× 4) | Signifikant? |
|---|---|---|---|
| Konzentration | 0,008 | 0,032 | Ja (0,032 < 0,05) |
| Gedächtnisleistung | 0,031 | 0,124 | Nein |
| Reaktionszeit | 0,049 | 0,196 | Nein |
| Stressniveau | 0,001 | 0,004 | Ja (0,004 < 0,05) |
Ohne Korrektur wären drei der vier Tests signifikant (p < 0,05). Nach der Bonferroni-Adjustierung bleiben nur zwei Ergebnisse signifikant. Die Gedächtnisleistung und die Reaktionszeit wären ohne Korrektur möglicherweise fälschlicherweise als Trainingseffekte interpretiert worden.