Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Clusterung

Clustering / Cluster-Analyse · Maximilian Fuchs · 24. April 2026 · 5 Min. Lesezeit

Was versteht man unter Clusterung?

Clusterung (englisch: Clustering) bezeichnet ein Verfahren der explorativen Datenanalyse, bei dem Beobachtungen anhand ihrer Ähnlichkeit in Gruppen – sogenannte Cluster – eingeteilt werden. Das Ziel ist dabei, dass Objekte innerhalb eines Clusters möglichst ähnlich zueinander sind (Intra-Cluster-Homogenität), während sich die Cluster untereinander möglichst stark unterscheiden (Inter-Cluster-Heterogenität).

Clusterung ist ein unüberwachtes Lernverfahren (unsupervised learning): Es gibt keine vorgegebenen Klassen oder Zielvariablen – die Gruppenstruktur wird allein aus den Daten selbst ermittelt. Zu den bekanntesten Methoden gehören:

  • k-Means-Clustering: Teilt die Daten in k Cluster auf, indem es iterativ Clusterzentren (Centroids) berechnet und jede Beobachtung dem nächstgelegenen Centroid zuordnet.
  • Hierarchisches Clustering: Baut schrittweise eine Baumstruktur (Dendrogramm) auf, die alle Ähnlichkeitsbeziehungen zwischen den Beobachtungen abbildet.
  • DBSCAN: Erkennt Cluster beliebiger Form auf Basis von Dichtebereichen und kann Ausreißer explizit identifizieren.

Als Ähnlichkeitsmaß wird häufig die euklidische Distanz verwendet, die den geometrischen Abstand zweier Punkte im Merkmalsraum beschreibt:

Euklidische Distanz

Einfach erklärt Stell dir vor, du hast eine Liste von Studierenden mit Angaben zu Lernstunden und Prüfungsnoten. Beim Clustering lässt du den Computer selbstständig herausfinden, welche Studierenden sich ähneln – ohne vorher zu sagen, wie viele Gruppen es geben soll oder wie sie aussehen. Der Algorithmus sucht dann automatisch nach natürlichen Gruppen in den Daten.

Warum ist Clusterung für statistische Analysen wichtig?

Clusterung hilft dabei, in großen und unübersichtlichen Datensätzen verborgene Strukturen und Muster aufzudecken. Das ist besonders wertvoll, wenn man noch keine klare Hypothese hat und zunächst verstehen möchte, wie die Daten aufgebaut sind. In vielen wissenschaftlichen Disziplinen – von der Psychologie über die Biologie bis zur Wirtschaftsforschung – wird Clusterung eingesetzt, um Subgruppen in einer Population zu identifizieren.

Typische Anwendungsfelder sind:

  • Identifikation von Patientengruppen mit ähnlichen Symptombildern in der Medizin
  • Segmentierung von Kundengruppen im Marketing
  • Gruppierung von Genen mit ähnlichen Expressionsmustern in der Bioinformatik
  • Erkennung von Nutzertypen in der Sozial- und Verhaltenswissenschaft
Häufiger Fehler Bei k-Means muss die Anzahl der Cluster k vorab festgelegt werden – ohne inhaltliche Begründung wird hier oft geraten. Nutze Hilfsmittel wie die Ellenbogen-Methode (Elbow Method) oder den Silhouetten-Koeffizienten, um eine sinnvolle Clusteranzahl zu bestimmen. Außerdem reagiert k-Means empfindlich auf Ausreißer und unterschiedliche Skalierungen der Merkmale – eine vorherige Standardisierung der Variablen ist deshalb wichtig.
Gut zu wissen Clusterung ist ein exploratives Verfahren und liefert keine statistischen Signifikanztests. Die gefundenen Gruppen sind Hypothesen, die in einem nächsten Schritt inhaltlich interpretiert und idealerweise an unabhängigen Daten überprüft werden sollten.

Praxisbeispiel zu Clusterung

Eine Forscherin untersucht das Lernverhalten von 120 Studierenden. Sie erhebt zwei Merkmale: die durchschnittliche Anzahl wöchentlicher Lernstunden und die Anzahl besuchter Lehrveranstaltungen pro Semester. Sie möchte wissen, ob sich natürliche Gruppen unter den Studierenden erkennen lassen – ohne vorher Kategorien festzulegen.

Sie wendet ein k-Means-Clustering mit k = 3 an und standardisiert die Merkmale vorher auf einen Mittelwert von 0 und eine Standardabweichung von 1. Das Ergebnis:

Tabelle 1. Ergebnisse des k-Means-Clusterings (k = 3)
Cluster Ø Lernstunden / Woche Ø Lehrveranstaltungen Interpretation
1 3,2 2,1 Wenig engagierte Studierende
2 8,5 5,4 Durchschnittlich engagierte Studierende
3 15,8 8,9 Sehr engagierte Studierende

Die drei Cluster unterscheiden sich klar in beiden Merkmalen und lassen sich inhaltlich gut interpretieren. Die Forscherin kann diese Gruppenstruktur nun als Ausgangspunkt für weiterführende Analysen nutzen – etwa um zu untersuchen, ob die Cluster mit Prüfungsleistungen zusammenhängen.

Clusteranalyse k-Means Explorative Datenanalyse Unüberwachtes Lernen Mustererkennung Ähnlichkeitsmaß Hierarchisches Clustering Segmentierung

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!