Daten erhoben – wie beginnt man mit der Auswertung?
In diesem Beitrag
Nicht sofort rechnen – was zuerst kommt
Der häufigste Fehler nach der Datenerhebung: Die Software wird geöffnet, und als Erstes werden Hypothesentests berechnet. Das klingt effizient, führt aber regelmäßig zu Problemen – weil fehlerhafte oder schlecht strukturierte Daten falsche Ergebnisse produzieren, die erst Wochen später auffallen.
Der erste Auswertungsschritt ist deshalb nicht die Berechnung eines Tests, sondern die Herstellung eines geprüften, reproduzierbaren Analyse-Datensatzes. Empirische Forschungsmethodik beschreibt den Übergang von der Datenerhebung zur Analyse ausdrücklich als Phase der Datenverarbeitung und Bereinigung – nicht als sofortigen Einstieg in die Inferenzstatistik.
Dieser Artikel führt Sie Schritt für Schritt durch den richtigen Einstieg in die Auswertung – von der Dateiorganisation bis zur Wahl des statistischen Verfahrens.
Schritt 1: Daten prüfen und bereinigen
Bevor Sie eine einzige Berechnung durchführen, sollten Sie sicherstellen, dass Ihre Daten vollständig, korrekt und nachvollziehbar sind. Dieser Schritt wird als Datenbereinigung (Data Cleaning) bezeichnet und ist methodisch zwingend notwendig.
Was konkret zu prüfen ist
- Vollständigkeit: Gibt es fehlende Werte (Missing Values)? Wo treten sie auf, und wie viele sind es pro Variable?
- Plausibilität: Sind alle Werte im erwarteten Bereich? (z. B. Alter von 300 Jahren oder negative Reaktionszeiten sind klare Fehler.)
- Duplikate: Wurden manche Fälle doppelt erfasst?
- Codierungskonsistenz: Sind kategoriale Variablen einheitlich codiert? (z. B. „m“, „M“ und „männlich“ für dieselbe Kategorie)
- Ausreißer: Gibt es extreme Werte, die auf Eingabefehler oder echte Extremfälle hindeuten?
Im Forschungsdatenmanagement werden diese Tätigkeiten in sechs Kernaktivitäten unterteilt: Discovering, Structuring, Cleaning, Enriching, Validating und Publishing. Diese Reihenfolge macht deutlich, dass Verstehen und Strukturieren der Daten noch vor der eigentlichen Bereinigung steht – bevor analytische Schlussfolgerungen gezogen werden.
Dokumentation der Bereinigung
Halten Sie jeden Bereinigungsschritt schriftlich fest: Welche Fälle wurden ausgeschlossen und warum? Wie wurden fehlende Werte behandelt? Diese Dokumentation gehört in die Methodenbeschreibung Ihrer Arbeit und ist Voraussetzung für Reproduzierbarkeit.
Dateiorganisation von Anfang an
Richten Sie eine klare Ordnerstruktur ein: Rohdaten, bereinigte Daten und Analysecode in getrennten Verzeichnissen. So bleibt der gesamte Analyseprozess für Sie – und bei Rückfragen für Ihre Betreuungsperson – nachvollziehbar. Eine saubere Datei- und Codeorganisation ist die Grundlage dafür, dass Versionen rekonstruiert werden können und klar ist, welcher Datensatz welchem Analyseschritt entspricht.
Schritt 2: Datenstruktur und Variablentypen klären
Sobald die Daten bereinigt sind, prüfen Sie, ob ihre Struktur zur geplanten Analyse passt. Statistisch sinnvoll auswertbare Datensätze liegen typischerweise in einer rechteckigen Struktur vor: eine Zeile pro Untersuchungseinheit (Person, Fall, Beobachtung), eine Spalte pro Variable.
Für die explorative Datenanalyse als methodischen Startpunkt sollten Forschende zunächst prüfen, ob diese Grundstruktur erfüllt ist – und ob Identifikatoren, Ergebnisvariablen und erklärende Variablen klar voneinander unterscheidbar sind.
Variablentypen bestimmen
Jede Variable hat ein Messniveau, das bestimmt, welche statistischen Verfahren zulässig sind:
| Messniveau | Beispiel | Zulässige Kennwerte |
|---|---|---|
| Nominal | Geschlecht, Studiengang | Häufigkeiten, Modus |
| Ordinal | Likert-Skala (1–5), Schulnoten | Median, Quartile |
| Intervall/Ratio | Alter (Jahre), Testergebnis (Punkte) | Mittelwert, Standardabweichung |
Das Messniveau ist keine Formalität – es entscheidet direkt darüber, ob Sie später einen t-Test, einen Mann-Whitney-U-Test oder eine Pearson-Korrelation berechnen dürfen. Wenn Sie sich bei der Testauswahl unsicher sind, hilft ein Entscheidungsbaum für statistische Tests als strukturierter Einstieg.
Schritt 3: Deskriptive Analyse und explorative Datenanalyse
Erst jetzt – nach Bereinigung und Strukturprüfung – beginnt die eigentliche Analyse. Und zwar nicht mit dem Hypothesentest, sondern mit der deskriptiven Statistik.
Was die deskriptive Analyse leistet
Deskriptive Kennwerte beschreiben Ihre Stichprobe und geben Ihnen ein erstes Gefühl für die Daten. Typische Angaben sind:
- Stichprobengröße (N), Geschlechterverteilung, Altersstruktur
- Mittelwerte und Standardabweichungen für metrische Variablen
- Häufigkeiten und Prozentwerte für kategoriale Variablen
- Minimum, Maximum und Spannweite
Diese Angaben gehören in Ihrer Arbeit in den Abschnitt zur Stichprobenbeschreibung und bilden die Grundlage für alle weiteren Analysen. Wie die Ergebnisse anschließend formal korrekt dargestellt werden, beschreibt unser Beitrag zur APA-konformen Darstellung statistischer Ergebnisse.
Explorative Datenanalyse (EDA)
Über die reinen Kennwerte hinaus empfiehlt sich eine explorative Betrachtung der Daten: Histogramme und Boxplots zeigen Verteilungen und Ausreißer. Streudiagramme machen Zusammenhänge zwischen zwei Variablen sichtbar. Diese visuelle Prüfung ist kein optionaler Zusatz – sie hilft Ihnen, Datenprobleme zu entdecken, die beim Bereinigen übersehen wurden, und liefert wichtige Hinweise auf die Wahl des richtigen Verfahrens.
Schritt 4: Das richtige Verfahren auswählen
Mit einem geprüften Datensatz und einem guten Überblick über Ihre Variablen können Sie jetzt das passende statistische Verfahren bestimmen. Die Auswahl hängt von drei zentralen Faktoren ab:
- Ihrer Forschungsfrage: Möchten Sie Gruppen vergleichen, Zusammenhänge untersuchen oder Vorhersagen treffen?
- Dem Messniveau Ihrer Variablen: Metrisch, ordinal oder nominal?
- Der Stichprobengröße und Verteilung: Sind parametrische Verfahren zulässig?
Welches Verfahren zu welcher Forschungsfrage passt, ist eine der häufigsten Unsicherheiten in Abschlussarbeiten. Unser Beitrag zum passenden statistischen Verfahren für Ihre Forschungsfrage hilft bei der Einordnung. Den grundlegenden Unterschied zwischen parametrischen und nichtparametrischen Tests erklärt außerdem unser Artikel zum Unterschied zwischen parametrischen und nichtparametrischen Verfahren.
Ein häufig unterschätzter Schritt ist die Erstellung eines Auswertungsplans vor der eigentlichen Berechnung: Welche Hypothese wird mit welchem Test an welchen Variablen geprüft? Ein solcher Plan verhindert, dass im Nachhinein Verfahren gewechselt werden, weil das Ergebnis nicht wie erwartet ausfällt – was methodisch unzulässig wäre. Wie ein solcher Plan aussieht, beschreibt unser Beitrag zum Auswertungsplan erstellen.
Schritt 5: Voraussetzungen prüfen
Bevor Sie einen statistischen Test berechnen, müssen Sie prüfen, ob Ihre Daten die Voraussetzungen dieses Verfahrens erfüllen. Das ist kein bürokratischer Formalakt, sondern methodisch notwendig – verletzt ein Datensatz zentrale Voraussetzungen, sind die Testergebnisse unter Umständen nicht interpretierbar.
Typische Voraussetzungen
- Normalverteilung: Viele parametrische Tests setzen voraus, dass die abhängige Variable annähernd normalverteilt ist (prüfbar über Shapiro-Wilk-Test oder Q-Q-Plot).
- Varianzhomogenität: Bei Gruppenvergleichen (z. B. t-Test, ANOVA) sollten die Varianzen in den Gruppen ähnlich sein (Levene-Test).
- Unabhängigkeit der Beobachtungen: Jede Person darf nur einmal im Datensatz vorkommen (bei Querschnittstudien).
- Ausreichende Stichprobengröße: Manche Verfahren erfordern Mindeststichprobengrößen, damit Testergebnisse stabil sind.
Eine detaillierte Übersicht über die zu prüfenden Voraussetzungen je nach Verfahren finden Sie in unserem Beitrag zu den Voraussetzungen vor der Auswertung.
Die Reihenfolge auf einen Blick
Alle beschriebenen Schritte folgen einer bewährten Logik, die sich in der empirischen Forschung etabliert hat. Wer sie einhält, vermeidet die häufigsten Fehler und stellt sicher, dass die Ergebnisse methodisch belastbar sind.
Checkliste: Einstieg in die Datenauswertung
- Rohdaten gesichert und unverändert aufbewahrt
- Ordnerstruktur angelegt (Rohdaten / bereinigte Daten / Analysecode)
- Datensatz auf fehlende Werte, Ausreißer und Inkonsistenzen geprüft
- Bereinigungsschritte dokumentiert
- Datenstruktur geprüft (eine Zeile pro Fall, Variablentypen klar)
- Messniveaus aller Variablen festgelegt
- Deskriptive Statistiken berechnet
- Explorative Visualisierungen erstellt (Histogramme, Boxplots)
- Auswertungsplan erstellt (Hypothese → Verfahren → Variablen)
- Voraussetzungen des gewählten Verfahrens geprüft
- Hypothesentests berechnet und Ergebnisse interpretiert
Für Studierende, die ihre Auswertung im Rahmen einer Bachelorarbeit oder Masterarbeit durchführen, lässt sich dieser Prozess noch weiter präzisieren – abhängig von Stichprobengröße, Forschungsdesign und den Anforderungen der jeweiligen Hochschule.
Wenn Sie sich bei einem dieser Schritte unsicher sind oder die Auswertung auf sicherem methodischen Fundament stehen soll, bietet die statistische Auswertung für empirische Abschlussarbeiten bei QuantExpert eine ganzheitliche methodische Begleitung – von der Datenprüfung bis zur Ergebnisinterpretation.
Und noch ein praktischer Hinweis zur Einordnung: Die hier beschriebene Reihenfolge gilt für quantitative Daten. Bei qualitativen Erhebungen – etwa Interviews oder offenen Antworten – folgt die Auswertung einer anderen Logik, die im Beitrag zur qualitativen und quantitativen Analyse im Vergleich erläutert wird.