Typ-II-Fehler
In diesem Beitrag
Was versteht man unter Typ-II-Fehler?
Der Typ-II-Fehler (auch Beta-Fehler oder Fehler 2. Art genannt) beschreibt die Situation, in der ein statistischer Test die Nullhypothese nicht ablehnt, obwohl sie in der Realität falsch ist. Mit anderen Worten: Ein tatsächlich vorhandener Effekt wird vom Test nicht erkannt.
Die Wahrscheinlichkeit, einen Typ-II-Fehler zu begehen, wird mit dem griechischen Buchstaben β (Beta) bezeichnet. Sie hängt direkt mit der sogenannten Teststärke (Power) zusammen:
Zusammenhang: Teststärke und Beta
Eine hohe Teststärke bedeutet also eine geringe Wahrscheinlichkeit für einen Typ-II-Fehler. Typischerweise wird β auf 0,20 festgelegt, was einer Teststärke von 80 % entspricht.
Warum ist der Typ-II-Fehler für statistische Analysen wichtig?
In der Praxis ist der Typ-II-Fehler besonders dann relevant, wenn das Nicht-Entdecken eines Effekts ernste Konsequenzen hätte – etwa in der medizinischen Forschung, wenn ein wirksames Medikament fälschlicherweise als unwirksam eingestuft wird.
Folgende Faktoren beeinflussen die Höhe von β und damit die Wahrscheinlichkeit eines Typ-II-Fehlers:
- Stichprobengröße: Eine größere Stichprobe senkt β, weil der Test präziser wird.
- Effektgröße: Große Effekte sind leichter zu entdecken als kleine. Bei kleinen Effekten steigt das Risiko eines Typ-II-Fehlers.
- Signifikanzniveau α: Ein strengeres Signifikanzniveau (z. B. α = 0,01 statt 0,05) erhöht β, weil die Hürde für eine Ablehnung der Nullhypothese steigt.
- Streuung der Daten: Hohe Varianz in den Daten erschwert den Nachweis eines Effekts.
Praxisbeispiel zu Typ-II-Fehler
Eine Pharmaforscherin möchte testen, ob ein neues Schmerzmittel wirksamer ist als das bisherige Standardpräparat. Sie formuliert ihre Hypothesen wie folgt:
- H₀: Das neue Mittel ist nicht wirksamer als das Standardpräparat.
- H₁: Das neue Mittel ist wirksamer.
Sie führt eine Studie mit nur 20 Probandinnen und Probanden durch. Der t-Test ergibt keinen signifikanten Unterschied (p = 0,12). Die Forscherin schlussfolgert, das neue Mittel sei nicht wirksamer.
Tatsächlich aber ist das neue Mittel wirksamer – der Effekt ist real, aber klein. Wegen der geringen Stichprobengröße hatte die Studie eine Teststärke von lediglich 45 %. Die Wahrscheinlichkeit, den tatsächlichen Effekt zu verpassen, lag also bei 55 %. Die Forscherin ist einem Typ-II-Fehler unterlegen.
| H₀ ist wahr | H₀ ist falsch | |
|---|---|---|
| H₀ wird nicht abgelehnt | Richtige Entscheidung (1 − α) | Typ-II-Fehler (β) ❌ |
| H₀ wird abgelehnt | Typ-I-Fehler (α) ❌ | Richtige Entscheidung – Power (1 − β) |
Eine a-priori Poweranalyse vor Studienbeginn hätte der Forscherin gezeigt, dass sie für einen kleinen Effekt bei α = 0,05 und einer angestrebten Power von 80 % mindestens etwa 200 Probandinnen und Probanden benötigt hätte.