Clusterung
In diesem Beitrag
Was versteht man unter Clusterung?
Clusterung (englisch: Clustering) bezeichnet ein Verfahren der explorativen Datenanalyse, bei dem Beobachtungen anhand ihrer Ähnlichkeit in Gruppen – sogenannte Cluster – eingeteilt werden. Das Ziel ist dabei, dass Objekte innerhalb eines Clusters möglichst ähnlich zueinander sind (Intra-Cluster-Homogenität), während sich die Cluster untereinander möglichst stark unterscheiden (Inter-Cluster-Heterogenität).
Clusterung ist ein unüberwachtes Lernverfahren (unsupervised learning): Es gibt keine vorgegebenen Klassen oder Zielvariablen – die Gruppenstruktur wird allein aus den Daten selbst ermittelt. Zu den bekanntesten Methoden gehören:
- k-Means-Clustering: Teilt die Daten in k Cluster auf, indem es iterativ Clusterzentren (Centroids) berechnet und jede Beobachtung dem nächstgelegenen Centroid zuordnet.
- Hierarchisches Clustering: Baut schrittweise eine Baumstruktur (Dendrogramm) auf, die alle Ähnlichkeitsbeziehungen zwischen den Beobachtungen abbildet.
- DBSCAN: Erkennt Cluster beliebiger Form auf Basis von Dichtebereichen und kann Ausreißer explizit identifizieren.
Als Ähnlichkeitsmaß wird häufig die euklidische Distanz verwendet, die den geometrischen Abstand zweier Punkte im Merkmalsraum beschreibt:
Euklidische Distanz
Warum ist Clusterung für statistische Analysen wichtig?
Clusterung hilft dabei, in großen und unübersichtlichen Datensätzen verborgene Strukturen und Muster aufzudecken. Das ist besonders wertvoll, wenn man noch keine klare Hypothese hat und zunächst verstehen möchte, wie die Daten aufgebaut sind. In vielen wissenschaftlichen Disziplinen – von der Psychologie über die Biologie bis zur Wirtschaftsforschung – wird Clusterung eingesetzt, um Subgruppen in einer Population zu identifizieren.
Typische Anwendungsfelder sind:
- Identifikation von Patientengruppen mit ähnlichen Symptombildern in der Medizin
- Segmentierung von Kundengruppen im Marketing
- Gruppierung von Genen mit ähnlichen Expressionsmustern in der Bioinformatik
- Erkennung von Nutzertypen in der Sozial- und Verhaltenswissenschaft
Praxisbeispiel zu Clusterung
Eine Forscherin untersucht das Lernverhalten von 120 Studierenden. Sie erhebt zwei Merkmale: die durchschnittliche Anzahl wöchentlicher Lernstunden und die Anzahl besuchter Lehrveranstaltungen pro Semester. Sie möchte wissen, ob sich natürliche Gruppen unter den Studierenden erkennen lassen – ohne vorher Kategorien festzulegen.
Sie wendet ein k-Means-Clustering mit k = 3 an und standardisiert die Merkmale vorher auf einen Mittelwert von 0 und eine Standardabweichung von 1. Das Ergebnis:
| Cluster | Ø Lernstunden / Woche | Ø Lehrveranstaltungen | Interpretation |
|---|---|---|---|
| 1 | 3,2 | 2,1 | Wenig engagierte Studierende |
| 2 | 8,5 | 5,4 | Durchschnittlich engagierte Studierende |
| 3 | 15,8 | 8,9 | Sehr engagierte Studierende |
Die drei Cluster unterscheiden sich klar in beiden Merkmalen und lassen sich inhaltlich gut interpretieren. Die Forscherin kann diese Gruppenstruktur nun als Ausgangspunkt für weiterführende Analysen nutzen – etwa um zu untersuchen, ob die Cluster mit Prüfungsleistungen zusammenhängen.