Rohdaten
In diesem Beitrag
Was versteht man unter Rohdaten?
Rohdaten (englisch: raw data) sind Daten in ihrer ursprünglichen, unverarbeiteten Form – so wie sie direkt bei der Datenerhebung anfallen. Sie wurden noch nicht bereinigt, transformiert, aggregiert oder auf andere Weise für eine Analyse aufbereitet. Rohdaten können aus Befragungen, Experimenten, Beobachtungen, Messungen oder automatischen Aufzeichnungen stammen.
Typische Merkmale von Rohdaten sind:
- Fehlende Werte (missing values), die noch nicht behandelt wurden
- Inkonsistente Schreibweisen oder Formate (z. B. Datumsangaben in verschiedenen Formaten)
- Mögliche Ausreißer oder Eingabefehler, die noch nicht geprüft wurden
- Keine Umkodierungen oder Skalentransformationen
Erst durch die Datenvorbereitung – auch Data Cleaning oder Datenaufbereitung genannt – werden Rohdaten in einen analysierbaren Zustand überführt.
Warum sind Rohdaten für statistische Analysen wichtig?
Rohdaten bilden die Grundlage jeder statistischen Analyse. Ohne sie gibt es nichts zu analysieren. Gleichzeitig ist der Umgang mit Rohdaten eine der kritischsten Phasen im gesamten Forschungsprozess – denn Fehler, die hier entstehen oder unentdeckt bleiben, pflanzen sich durch alle nachfolgenden Auswertungsschritte fort.
Für wissenschaftliche Arbeiten ist es zudem wichtig, Rohdaten sorgfältig zu dokumentieren und zu sichern. Viele Fachzeitschriften und Betreuungspersonen verlangen, dass Rohdaten nachvollziehbar und reproduzierbar vorliegen – etwa als ergänzendes Material oder in einem Forschungsdatenrepositorium.
Praxisbeispiel zu Rohdaten
Eine Studierende untersucht für ihre Bachelorarbeit, ob Schlafmangel die Prüfungsleistung beeinflusst. Sie befragt 80 Kommilitoninnen und Kommilitonen per Online-Fragebogen zu ihrer durchschnittlichen Schlafdauer und ihrer letzten Prüfungsnote.
Nach dem Export aus dem Umfragetool sieht ein Ausschnitt der Rohdaten so aus:
| ID | Schlafdauer (Std.) | Prüfungsnote | Alter |
|---|---|---|---|
| 001 | 6,5 | 2,3 | 22 |
| 002 | 1,7 | 24 | |
| 003 | 5 | 99 | 21 |
| 004 | 7,0 | 3,0 | dreiundzwanzig |
Schon auf den ersten Blick zeigen sich typische Rohdaten-Probleme: Bei ID 002 fehlt die Schlafdauer, bei ID 003 wurde offenbar ein Kodierungswert (99) für „keine Angabe“ eingetragen, der noch nicht als fehlend markiert wurde, und bei ID 004 wurde das Alter als Text statt als Zahl erfasst. All diese Punkte müssen im Rahmen der Datenbereinigung geklärt werden, bevor eine sinnvolle statistische Analyse möglich ist.