t-Test für unabhängige Stichproben
In diesem Beitrag
Was versteht man unter dem t-Test für unabhängige Stichproben?
Der t-Test für unabhängige Stichproben ist ein parametrisches Signifikanzverfahren, das prüft, ob sich die Mittelwerte zweier voneinander unabhängiger Gruppen statistisch bedeutsam unterscheiden. „Unabhängig“ bedeutet dabei: Die Personen oder Fälle in Gruppe A haben keinerlei inhaltliche oder statistische Verbindung zu den Personen in Gruppe B – sie wurden also weder gematcht noch wiederholt gemessen.
Die Prüfgröße, der sogenannte t-Wert, ergibt sich aus dem Quotienten von Mittelwertdifferenz und dem Standardfehler dieser Differenz:
Teststatistik
Dabei steht für den Mittelwert der ersten Gruppe, für den Mittelwert der zweiten Gruppe, und für den gepoolten Standardfehler, der die Streuung in beiden Gruppen sowie die jeweiligen Stichprobengrößen berücksichtigt. Der resultierende t-Wert wird anschließend mit einem kritischen Wert aus der t-Verteilung verglichen – oder es wird direkt der p-Wert berichtet.
Damit der Test korrekte Ergebnisse liefert, müssen einige Voraussetzungen erfüllt sein:
- Die abhängige Variable ist metrisch skaliert (intervall- oder verhältnisskaliert).
- Die Beobachtungen in beiden Gruppen sind unabhängig voneinander.
- Die Werte sind in beiden Gruppen annähernd normalverteilt – bei größeren Stichproben (n > 30 je Gruppe) ist der Test durch den zentralen Grenzwertsatz jedoch robust gegenüber Verletzungen dieser Annahme.
- Die Varianzen beider Gruppen sind gleich (Varianzhomogenität). Diese Annahme wird üblicherweise per Levene-Test geprüft. Ist sie verletzt, wird statt des klassischen t-Tests der Welch-Test verwendet, der die Freiheitsgrade entsprechend anpasst.
Warum ist der t-Test für unabhängige Stichproben für statistische Analysen wichtig?
Der t-Test für unabhängige Stichproben gehört zu den am häufigsten eingesetzten Verfahren in der empirischen Forschung – ob in der Psychologie, Medizin, Wirtschaftswissenschaft oder Pädagogik. Überall dort, wo zwei Gruppen verglichen werden sollen, ist er das natürliche Mittel der Wahl: Wirkt eine neue Therapie besser als die Standardbehandlung? Unterscheiden sich Männer und Frauen in ihrem durchschnittlichen Testergebnis? Erzielen zwei Unterrichtsmethoden verschiedene Lernergebnisse?
Ein entscheidender Vorteil ist die verhältnismäßig einfache Interpretierbarkeit: Der p-Wert zeigt an, ob der beobachtete Mittelwertunterschied statistisch signifikant ist. Ergänzend sollte jedoch immer die Effektgröße – typischerweise Cohen’s d – berichtet werden, da ein signifikantes Ergebnis bei großen Stichproben auch dann auftreten kann, wenn der tatsächliche Unterschied praktisch bedeutungslos ist.
Praxisbeispiel zu t-Test für unabhängige Stichproben
Eine Forscherin untersucht, ob eine neue Lernsoftware die Prüfungsleistung von Studierenden verbessert. Sie teilt 60 Studierende zufällig in zwei Gruppen auf: 30 nutzen die neue Software (Experimentalgruppe), 30 lernen mit dem klassischen Lehrbuch (Kontrollgruppe). Am Ende des Semesters werden die Prüfungspunkte erhoben.
| Gruppe | n | Mittelwert (Punkte) | Standardabweichung |
|---|---|---|---|
| Experimentalgruppe (Software) | 30 | 74,2 | 8,5 |
| Kontrollgruppe (Lehrbuch) | 30 | 68,6 | 9,1 |
Der Levene-Test ergibt keine signifikante Verletzung der Varianzhomogenität, sodass der klassische t-Test angewendet werden kann. Das Ergebnis lautet: t(58) = 2,43, p = .018, d = 0,64. Der Mittelwertunterschied von 5,6 Punkten ist statistisch signifikant und entspricht einem mittleren Effekt nach Cohen. Die Forscherin kann schlussfolgern, dass die Lernsoftware die Prüfungsleistung in dieser Stichprobe bedeutsam verbessert hat – und sollte diesen Befund im Rahmen einer Replikationsstudie absichern.
Die Ergebnisberichterstattung in einer wissenschaftlichen Arbeit würde typischerweise so aussehen: „Die Experimentalgruppe erzielte signifikant höhere Prüfungsleistungen (M = 74,2, SD = 8,5) als die Kontrollgruppe (M = 68,6, SD = 9,1), t(58) = 2,43, p = .018, d = 0,64.“