Wenn Daten chaotisch sind, hilft auch die beste Statistik nicht
In diesem Beitrag
Die Analyse ist fast fertig, die Abgabe naht. Und dann taucht die Frage auf, die niemand erwartet hat: Welche Datei war noch mal die finale Version? Warum wurden diese 14 Fälle ausgeschlossen? Und welche Variable wurde umcodiert, und auf welcher Grundlage?
Genau in diesem Moment zeigt sich, ob eine empirische Arbeit wirklich auf solidem Fundament steht oder nicht. Nicht beim p-Wert. Nicht beim Konfidenzintervall. Sondern viel früher.
Die Schwachstelle liegt nicht dort, wo Sie sie vermuten
Viele Studierende glauben, das größte Risiko einer empirischen Arbeit liege im falschen Testverfahren. Das ist verständlich, denn Statistik wirkt komplex und wird deshalb als Hauptquelle möglicher Fehler wahrgenommen.
Tatsächlich liegt die häufigste Schwachstelle woanders: in der Datei namens final_final_neu_v3.xlsx, in fehlenden Codebooks, in uneinheitlich codierten Missing Values, in undokumentierten Bereinigungsschritten und in Syntax, die niemand mehr nachvollziehen kann.
Im Kolloquium oder bei der Begutachtung wird nicht nur gefragt, welches Verfahren Sie gewählt haben. Es wird gefragt, warum bestimmte Fälle ausgeschlossen wurden, wie Missing Values behandelt wurden und ob die Analyse reproduzierbar ist. Wer darauf keine klare Antwort hat, steht trotz korrekter Statistik schwach da.
Was Forschungsdatenmanagement wirklich bedeutet
Forschungsdatenmanagement klingt nach Bürokratie. Nach Checklisten für Großprojekte. Nach etwas, das nur Forschungsgruppen mit Drittmittelförderung betrifft. Dieser Eindruck ist falsch und kostspielig.
Die Deutsche Forschungsgemeinschaft ist in diesem Punkt unmissverständlich: Der fachlich angemessene Umgang mit Forschungsdaten ist ein wesentlicher Bestandteil qualitätsorientierter und anschlussfähiger Forschung. Forschungsdaten sollen sorgfältig geplant, dokumentiert und beschrieben werden. Und zu diesen Daten zählt die DFG ausdrücklich Surveydaten, Beobachtungsdaten, Testverfahren, Fragebögen und audiovisuelle Informationen, also genau das, womit empirische Abschlussarbeiten typischerweise arbeiten.
Auch die Syntax gehört dazu
Was viele überrascht: Die DFG rechnet ausdrücklich auch Software zur sorgfältigen Datenpraxis. Das bedeutet konkret, dass die Syntax oder das Skript, mit dem Daten bereinigt und ausgewertet werden, dokumentiert und nachvollziehbar sein muss. Ein Klick-durch-SPSS-Protokoll reicht dafür nicht.
Diese Anforderung klingt anspruchsvoll, ist in der Praxis aber einfacher umzusetzen als gedacht. Wer von Anfang an eine klare Ordnerstruktur anlegt, Rohdaten von Arbeitsdaten trennt und Bereinigungsschritte in der Syntax festhält, hat den Großteil dieser Anforderung bereits erfüllt.
„Pseudonymisiert“ ist nicht dasselbe wie „anonym“
Ein weiterer Bereich, der in empirischen Arbeiten regelmäßig unterschätzt wird, ist der Datenschutz. Und hier gibt es eine verbreitete Fehlannahme, die konkrete Konsequenzen haben kann.
Der Europäische Datenschutzausschuss hat Anfang 2025 in seinen neuen Leitlinien zur Pseudonymisierung klargestellt: Pseudonymisierte Daten können weiterhin personenbezogene Daten sein, wenn sie mit Zusatzinformationen einer Person zugeordnet werden können. Pseudonymisierung ist eine mögliche Schutzmaßnahme, ersetzt aber keine durchdachte Datenschutzdokumentation.
Was das für Ihre Arbeit bedeutet
Viele Studierende gehen davon aus, dass es reicht, Namen aus der Tabelle zu löschen. Tatsächlich entstehen die relevanten datenschutzbezogenen Entscheidungen viel früher: Welche Identifikatoren werden in welcher Datei gespeichert? Wo liegt eine Schlüsselliste? Welche Variablen könnten in Kombination eine Zuordnung ermöglichen?
Das sind keine technischen Kleinigkeiten. Das sind methodische und rechtliche Weichenstellungen, die getroffen werden müssen, bevor die erste Zeile Syntax geschrieben wird.
Besonders deutlich wird das im Bereich Gesundheitsdaten. Die im März 2025 in Kraft getretene EHDS-Regelung zeigt, in welche Richtung sich regulierte Forschungsdatenpraxis entwickelt: Sekundärnutzung von Gesundheitsdaten für wissenschaftliche Forschung soll künftig strukturierter möglich sein, aber nur über Genehmigungen, sichere Verarbeitungsumgebungen und den Einsatz anonymisierter oder pseudonymisierter Daten. Re-Identifikation ist ausdrücklich untersagt. Für psychologische, medizinische und gesundheitswissenschaftliche Abschlussarbeiten ist das kein ferner Regulierungsrahmen, sondern eine konkrete Einordnungshilfe für die eigene Praxis.
Kein Drittmittelprojekt, kein Thema? Diese Annahme ist falsch
Hier liegt der eigentliche Wendepunkt dieses Kommentars. Forschungsdatenmanagement wird in vielen Köpfen immer noch als Thema für Forschungsgruppen, Repositorien und Open-Science-Initiativen abgelegt. Als etwas, das erst relevant wird, wenn Daten veröffentlicht oder nachgenutzt werden sollen.
Das ist ein Irrtum mit Konsequenzen.
Die entscheidende Frage lautet nicht, ob Daten später geteilt werden. Die entscheidende Frage lautet: Ist der Weg von Rohdaten zu Ergebnissen nachvollziehbar? Können Entscheidungen erklärt werden? Kann die Analyse reproduziert werden? Ist die Datenhaltung datenschutzkonform?
Forschungsdatenmanagement beginnt nicht dort, wo die Statistik endet. Es beginnt dort, wo aus Rohdaten wissenschaftliche Evidenz werden soll.
Wer Bereinigungsschritte nicht dokumentiert, schwächt die Nachvollziehbarkeit der gesamten Analyse. Wer keine saubere Versionierung führt, riskiert, auf einer falschen Datenbasis zu rechnen. Wer Missing Values nicht einheitlich behandelt und das nicht festhält, öffnet im Kolloquium eine Flanke, die sich hätte schließen lassen.
Eine empirische Arbeit ist dann verteidigungsfähig, wenn Sie im Kolloquium jeden Schritt zwischen Rohdaten und Ergebnis begründen können. Das setzt voraus, dass dieser Weg dokumentiert wurde. Kein Prüfungsausschuss erwartet Perfektion, aber Nachvollziehbarkeit ist kein Bonus, sondern eine Grundvoraussetzung.
Ihr pragmatischer Einstieg: der Mini-DMP
Was hilft? Keine ausufernde Dokumentation, keine universitären Infrastrukturanforderungen, kein Softwareprojekt. Was hilft, ist ein pragmatischer Datenmanagementplan, der die wichtigsten Fragen beantwortet, bevor die Auswertung beginnt.
Die Czech National Library of Technology fasst es treffend zusammen: Data Management Planning sollte bereits in frühen Projektphasen als Teil des Forschungsdesigns beginnen und Speicherlösungen, Dokumentation, rechtliche und ethische Fragen umfassen. Das gilt nicht nur für große Förderprojekte, sondern für jede empirische Arbeit.
Was ein pragmatischer Mini-DMP festhalten sollte
Mini-DMP: Diese Punkte sollten vor der Auswertung geklärt sein
- Wo liegen die Rohdaten, und wer hat Zugriff darauf?
- Welche Datei ist die bereinigte Arbeitsdatei, und wie ist sie benannt?
- Welche Variablen gibt es, und wie sind sie codiert? (Codebook)
- Wie werden Missing Values behandelt, und ist das einheitlich dokumentiert?
- Welche Fälle wurden ausgeschlossen, und aus welchem Grund?
- Welche Syntax oder welches Skript erzeugt die finalen Ergebnisse?
- Wo liegen Output, Tabellen und Abbildungen?
- Welche personenbezogenen Informationen wurden entfernt, getrennt oder geschützt?
- Welche Version ist die finale Analysegrundlage?
Ein Codebook ist kein Anhang für Perfektionisten, sondern ein Schutz gegen Missverständnisse, auch gegen Ihre eigenen in drei Wochen. Und Missing Values sind keine Nebensache, sondern eine methodische Entscheidung, die begründet werden muss.
Was QuantExpert dabei unterstützt
Bei QuantExpert begleiten wir empirische Arbeiten nicht erst beim Signifikanztest. Wir unterstützen bei der Datenaufbereitung, bei der Entwicklung sauberer Codebooks, bei der Dokumentation von Bereinigungsentscheidungen, bei der Erstellung reproduzierbarer Syntax in SPSS, R, Stata, Jamovi und weiteren Programmen sowie bei der methodisch nachvollziehbaren Darstellung der Ergebnisse. Diskret, vertraulich und auf Ihre konkrete Arbeit zugeschnitten.
Wer Rohdaten, Arbeitsdaten, Syntax, Output und Entscheidungen sauber trennt und dokumentiert, macht seine Analyse prüfbarer, belastbarer und verteidigungsfähiger. Das ist kein Mehraufwand, das ist Qualitätsarbeit.
Die Qualität einer empirischen Arbeit entscheidet sich nicht im letzten Schritt. Sie entscheidet sich in den Entscheidungen, die lange vorher getroffen werden. Wer seine Daten nicht erklären kann, kann auch seine Ergebnisse nur begrenzt verteidigen.
Datenaufbereitung
Datenschutz
Empirische Arbeit
Reproduzierbarkeit