Wie misst man Umfrageergebnisse?
In diesem Beitrag
Was bedeutet „Messen“ bei Umfragen?
Umfrageergebnisse zu messen bedeutet mehr, als Prozentwerte auszuzählen. Messen heißt in der empirischen Sozialforschung: einem beobachtbaren Merkmal – etwa Zufriedenheit, Einstellung oder Verhalten – eine Zahl so zuordnen, dass diese Zahl inhaltlich etwas Sinnvolles aussagt.
Ob das gelingt, hängt von Entscheidungen ab, die weit vor der eigentlichen Datenerhebung getroffen werden: Welche Konstrukte sollen erfasst werden? Wie werden Fragen formuliert? Welches Antwortformat kommt zum Einsatz? Und welche statistische Methode wertet die Rohdaten aus?
Die Qualität einer Umfrage lässt sich nicht an ihrer Größe oder öffentlichen Reichweite messen, sondern daran, wie sorgfältig potenzielle Fehlerquellen verhindert, erkannt und behandelt wurden. Das gilt für großangelegte Bevölkerungsumfragen genauso wie für Fragebögen in Bachelorarbeiten.
Skalenniveaus: Die Grundlage jeder Messung
Das Skalenniveau einer Frage bestimmt, welche statistischen Operationen erlaubt sind. Es ist die erste Entscheidung, die Sie bei der Messung von Umfrageergebnissen treffen müssen.
| Skalenniveau | Eigenschaft | Beispiel im Fragebogen | Erlaubte Statistik |
|---|---|---|---|
| Nominal | Kategorien ohne Rangordnung | Geschlecht, Studienfach | Häufigkeiten, Modus, Chi-Quadrat |
| Ordinal | Rangordnung, aber ungleiche Abstände | Schulnoten, Likert-Items | Median, Rangkorrelation |
| Intervall | Gleiche Abstände, kein absoluter Nullpunkt | Temperatur in Celsius, viele Skalen-Scores | Mittelwert, Standardabweichung, t-Test |
| Ratio | Absoluter Nullpunkt vorhanden | Alter in Jahren, Einkommen in € | Alle Verfahren inkl. Verhältnisbildung |
In der Praxis entstehen bei Fragebögen besonders häufig ordinale Daten – etwa wenn Befragte auf einer Skala von „stimme voll zu“ bis „stimme gar nicht zu“ antworten. Ob solche Daten wie Intervallskalen behandelt werden dürfen, ist methodisch umstritten, in der sozialwissenschaftlichen Praxis aber verbreitet, sofern bestimmte Voraussetzungen erfüllt sind.
Rating-Skalen und Likert-Items richtig einsetzen
Das am häufigsten verwendete Messinstrument in Fragebögen ist die Rating-Skala: Befragte positionieren sich auf einem Kontinuum, das ein Merkmal wie Zustimmung, Häufigkeit, Intensität oder Zufriedenheit abbildet.
Wie viele Stufen braucht eine Skala?
Rating-Skalen sind Kontinua, mit denen Merkmale wie Zustimmung, Intensität oder Zufriedenheit gemessen werden. In der Forschungspraxis werden häufig fünf bis sieben Antwortkategorien empfohlen, weil zu wenige Stufen die Differenzierung verhindern, während zu viele Stufen das Verständnis einzelner Abstufungen erschweren.
Ein klassisches Beispiel aus der internationalen Forschungspraxis ist eine 11-Punkte-Skala (0 = „extremely dissatisfied“ bis 10 = „extremely satisfied“), wie sie etwa im European Social Survey eingesetzt wird. Für studentische Arbeiten ist eine 5- oder 7-stufige Skala meist gut handhabbar und methodisch ausreichend begründbar.
Beschriftung und Polung
Ob Sie Ihre Skala vollständig verbal beschriften oder nur die Endpole kennzeichnen, hat messtheoretische Konsequenzen. Vollständig beschriftete Skalen können die Reliabilität und Validität verbessern und helfen insbesondere Befragten mit geringerer formaler Bildung, die Abstufungen korrekt zu interpretieren.
Achten Sie zudem auf die Polung: Wenn positive und negative Items gemischt sind, müssen negative Items vor der Auswertung umgepolt werden – sonst verfälschen sie den Gesamtscore.
Welche Kennzahlen beschreiben Umfrageergebnisse?
Sobald die Daten vorliegen, brauchen Sie geeignete Kennzahlen, um die Ergebnisse zu beschreiben. Welche Sie wählen, hängt vom Skalenniveau ab.
Deskriptive Statistik für geschlossene Fragen
- Häufigkeiten und Prozentsätze: Die einfachste Form – wie viele Personen haben Option A, B oder C gewählt?
- Modus: Die häufigste Antwortkategorie; sinnvoll bei nominalen Daten.
- Median: Der mittlere Wert bei Rangordnungen; robuster gegenüber Extremwerten als der Mittelwert.
- Mittelwert () und Standardabweichung (SD): Für metrische oder quasi-metrische Skalen; zeigen, wo die Antworten im Schnitt liegen und wie stark sie streuen.
Mittelwert eines Skalen-Scores
Wenn Sie mehrere Items zu einem Konstrukt zusammenfassen (z. B. fünf Fragen zur Arbeitszufriedenheit), bilden Sie einen Skalenmittelwert oder einen Summenscore. Vor dieser Aggregation sollten Sie die interne Konsistenz der Skala prüfen – in der Regel mit Cronbachs Alpha.
Kennzahlen für offene Fragen
Offene Antworten entziehen sich der rein numerischen Messung. Hier kommen qualitative Verfahren ins Spiel: Kategorienbildung, thematische Analyse oder inhaltsanalytische Kodierung. Wie das konkret funktioniert, erläutert unser Beitrag zur Analyse qualitativer Umfrageantworten.
Response Rate, Konfidenzintervall und Fehlermarge
Gute Umfragemessung endet nicht beim Mittelwert. Drei weitere Größen sind für die korrekte Einordnung Ihrer Ergebnisse unverzichtbar.
Response Rate
Die Rücklaufquote (Response Rate) gibt an, wie viele der eingeladenen Personen tatsächlich geantwortet haben. Sie berechnet sich als:
Response Rate
Eine niedrige Rücklaufquote erhöht das Risiko eines Non-Response-Bias: Bestimmte Gruppen antworten systematisch seltener, was die Ergebnisse verzerren kann. Deshalb sollten Sie im Methodenteil Ihrer Arbeit die Response Rate transparent berichten und kommentieren.
Konfidenzintervall und Fehlermarge
Ein Konfidenzintervall gibt an, in welchem Bereich der wahre Wert in der Grundgesamtheit mit einer bestimmten Wahrscheinlichkeit liegt. Ein 95-Prozent-Konfidenzniveau bedeutet, dass bei wiederholter Durchführung vieler gleichartiger Umfragen 95 von 100 Konfidenzintervallen den wahren Wert einschließen würden.
Die dazugehörige Fehlermarge (Margin of Error) beschreibt den Bereich ober- und unterhalb der Stichprobenstatistik, innerhalb dessen der wahre Wert mit der gewählten Sicherheit liegt. In wissenschaftlichen Berichten sollten Konfidenzintervalle zusammen mit Punktschätzern angegeben werden – nicht erst auf Nachfrage.
Repräsentativität und Gewichtung
Wenn bestimmte Gruppen in Ihrer Stichprobe über- oder unterrepräsentiert sind, können Sie die Zusammensetzung der Antworten per Chi-Quadrat-Anpassungstest mit der bekannten Grundgesamtheit vergleichen. Bei systematischen Abweichungen ist eine Post-Stratification-Gewichtung eine Option – oder zumindest eine transparente Diskussion der Einschränkungen im Methodenteil.
Qualität der Messung sicherstellen
Umfrageergebnisse zu messen bedeutet auch, die Güte dieser Messung zu kennen. Die klassischen Gütekriterien sind:
- Objektivität: Sind die Ergebnisse unabhängig davon, wer die Umfrage durchführt und auswertet?
- Reliabilität: Liefert das Instrument bei wiederholter Anwendung unter gleichen Bedingungen stabile Ergebnisse?
- Validität: Misst das Instrument tatsächlich das, was es messen soll?
Reliabilität und Validität hängen direkt mit der Skalengestaltung zusammen. Wie erwähnt, können vollständig beschriftete Antwortoptionen die Test-Retest-Reliabilität messbar verbessern – ein Detail, das bei der Fragebogenkonstruktion oft unterschätzt wird.
Ob Fragebögen grundsätzlich zuverlässig messen, hängt dabei weniger vom Format als von der Sorgfalt bei Konstruktion, Pretesting und Durchführung ab.
Erhebungsmodus und Stichprobenrahmen
Auch der Erhebungsmodus beeinflusst, was und wie gemessen wird. Online-Umfragen sind schnell und kostengünstig, können aber ältere, einkommensschwächere oder ländlich lebende Personen systematisch schlechter erreichen. Telefonische Befragungen bieten mehr Unterstützung durch Interviewende, sind aber aufwendiger. Die Wahl des Modus muss deshalb zum Forschungsziel und zur angestrebten Grundgesamtheit passen – beides sind Messentscheidungen, keine bloßen Logistikfragen.
Wer noch in der Planungsphase steckt und unsicher ist, welches Erhebungsinstrument zur eigenen Fragestellung passt, findet bei der methodischen Begleitung für empirische Abschlussarbeiten eine strukturierte Unterstützung – von der Konzeption bis zur fertigen Auswertung.
Von der Messung zur Auswertung
Messung und Auswertung greifen ineinander. Wer die Messlogik von Beginn an sauber plant, spart bei der Auswertung erheblich Zeit und vermeidet häufige Stolperstellen.
Praktische Schritte im Überblick
- Dateneingabe und -bereinigung: Fehlende Werte identifizieren, Dubletten entfernen, Kodierplan anlegen.
- Deskriptive Analyse: Häufigkeiten, Mittelwerte, Streuungsmaße – je nach Skalenniveau.
- Skalenprüfung: Cronbachs Alpha bei Multi-Item-Skalen, ggf. explorative Faktorenanalyse.
- Inferenzstatistik: Hypothesentests (t-Test, ANOVA, Chi-Quadrat, Regression) abhängig vom Forschungsdesign.
- Ergebnisdarstellung: Tabellen, Diagramme, Konfidenzintervalle, Effektstärken.
Wie Sie dabei konkret vorgehen, hängt von Ihrer Software ab. Eine schrittweise Anleitung finden Sie im Beitrag zur Umfrageauswertung von der Rohdatei zum Ergebnis. Wer speziell mit SPSS arbeitet, findet dort ebenfalls eine detaillierte Schritt-für-Schritt-Anleitung zur Fragebogenauswertung mit SPSS.
Und falls Sie sich fragen, ob neben der quantitativen Messung auch qualitative Elemente in Ihrem Fragebogen sinnvoll sind: Offene Items lassen sich durchaus wissenschaftlich auswerten – wie das geht, erklärt der Beitrag zur qualitativen Auswertung von Fragebögen.
Entscheidend ist am Ende, dass Messung, Auswertungsstrategie und Ergebnisdarstellung eine konsistente Einheit bilden. Wer diese drei Ebenen bereits bei der Fragebogenkonstruktion mitdenkt, legt den Grundstein für eine methodisch überzeugende empirische Arbeit.