Statistische Signifikanz vs. klinische Relevanz
In diesem Beitrag
Was versteht man unter statistischer Signifikanz vs. klinischer Relevanz?
Diese beiden Konzepte beziehen sich auf unterschiedliche Fragen, die eine Studie beantworten kann – und die häufig verwechselt oder gleichgesetzt werden.
Statistische Signifikanz
Ein Ergebnis gilt als statistisch signifikant, wenn der beobachtete Effekt mit hoher Wahrscheinlichkeit nicht allein durch Zufall entstanden ist. Gemessen wird dies über den p-Wert: Liegt er unterhalb eines vorab festgelegten Signifikanzniveaus – üblicherweise – wird das Ergebnis als statistisch signifikant bezeichnet.
Der p-Wert beantwortet dabei die Frage: Wie wahrscheinlich wäre es, ein Ergebnis dieser Größe oder extremer zu beobachten, wenn die Nullhypothese wahr wäre? Er macht keine Aussage darüber, wie groß oder bedeutsam ein Effekt in der Praxis ist.
Klinische Relevanz
Klinische Relevanz – auch praktische oder inhaltliche Bedeutsamkeit genannt – beschreibt, ob ein Effekt groß genug ist, um im realen Anwendungskontext einen spürbaren Unterschied zu machen. Hier spielen Effektgrößen wie Cohens d, das Odds Ratio oder das Number Needed to Treat (NNT) eine zentrale Rolle, ergänzt durch inhaltliches Fachwissen.
Warum ist die Unterscheidung für statistische Analysen wichtig?
Die Verwechslung dieser beiden Konzepte zählt zu den häufigsten Fehlern in der Interpretation wissenschaftlicher Studien – mit potenziell ernsthaften Konsequenzen, etwa wenn ineffektive Behandlungen als wirksam eingestuft werden.
Der entscheidende Zusammenhang: Statistische Signifikanz hängt stark von der Stichprobengröße ab. Bei sehr großen Stichproben können selbst minimale, praktisch bedeutungslose Unterschiede hochsignifikant werden. Umgekehrt können bei kleinen Stichproben klinisch relevante Effekte statistisch nicht nachweisbar sein – obwohl sie real existieren.
Für eine vollständige Interpretation einer Studie braucht es daher immer beide Perspektiven:
- Ist der Effekt statistisch signifikant? – Kann er als zufällig ausgeschlossen werden?
- Ist der Effekt klinisch relevant? – Ist er groß genug, um in der Praxis bedeutsam zu sein?
Praxisbeispiel zu statistischer Signifikanz vs. klinischer Relevanz
Eine pharmazeutische Studie untersucht, ob ein neues Blutdruckmittel den systolischen Blutdruck stärker senkt als ein etabliertes Standardpräparat. Es werden n = 10.000 Patientinnen und Patienten eingeschlossen.
| Kennwert | Neues Mittel | Standardpräparat |
|---|---|---|
| Mittlere Blutdrucksenkung | 18,3 mmHg | 17,9 mmHg |
| Unterschied | 0,4 mmHg | |
| p-Wert | 0,003 (statistisch signifikant) | |
| Cohens d | 0,04 (vernachlässigbar klein) | |
Das Ergebnis ist statistisch signifikant – der p-Wert liegt deutlich unter 0,05. Klinisch betrachtet ist ein Unterschied von 0,4 mmHg jedoch ohne jede Bedeutung: Blutdruckschwankungen in dieser Größenordnung entstehen allein durch Körperhaltung oder Tageszeit. Die Effektgröße Cohens d von 0,04 bestätigt: Der Effekt ist verschwindend gering.
In der Praxis würde man das neue, möglicherweise teurere oder nebenwirkungsreichere Präparat auf Basis dieses Ergebnisses nicht als überlegen einschätzen – trotz statistischer Signifikanz.