Hauptkomponentenanalyse
In diesem Beitrag
Was versteht man unter Hauptkomponentenanalyse?
Die Hauptkomponentenanalyse (kurz: HKA oder PCA, von englisch Principal Component Analysis) ist ein statistisches Verfahren zur Dimensionsreduktion. Sie transformiert einen Datensatz mit vielen Variablen in einen neuen Satz von Variablen – den sogenannten Hauptkomponenten –, der die wesentliche Streuung der Originaldaten möglichst vollständig erhält, aber mit deutlich weniger Dimensionen auskommt.
Die Hauptkomponenten sind Linearkombinationen der ursprünglichen Variablen. Die erste Hauptkomponente erklärt den größten Anteil der Gesamtvarianz, die zweite den nächstgrößten Anteil – unter der Bedingung, dass sie orthogonal (also unkorreliert) zur ersten steht, und so weiter. Mathematisch werden die Hauptkomponenten über die Eigenvektoren der Kovarianzmatrix der standardisierten Daten bestimmt.
Varianzanteil der k-ten Hauptkomponente
Dabei steht für den Eigenwert der k-ten Hauptkomponente und für die Summe aller Eigenwerte. Je höher der Anteil, desto mehr Varianz – also Information – steckt in dieser Komponente.
Warum ist die Hauptkomponentenanalyse für statistische Analysen wichtig?
In der empirischen Forschung arbeitet man häufig mit Datensätzen, die sehr viele Variablen enthalten. Das führt zu mehreren Problemen: Viele statistische Modelle reagieren empfindlich auf Multikollinearität (starke Korrelationen zwischen Prädiktoren), und mit steigender Variablenzahl wächst das Risiko von Overfitting. Die PCA kann hier auf verschiedene Weisen helfen:
- Dimensionsreduktion: Wenige Hauptkomponenten repräsentieren den Großteil der Varianz – der Datensatz wird handlicher, ohne wesentliche Information zu verlieren.
- Beseitigung von Multikollinearität: Da die Hauptkomponenten per Definition unkorreliert sind, können sie als unabhängige Prädiktoren in Regressionsmodellen eingesetzt werden.
- Visualisierung: Hochdimensionale Daten lassen sich durch die ersten zwei oder drei Hauptkomponenten grafisch darstellen und explorativ erkunden.
- Vorverarbeitung: In maschinellen Lernverfahren wird die PCA häufig als Vorverarbeitungsschritt genutzt, um Rechenaufwand zu reduzieren und Rauschen zu minimieren.
Praxisbeispiel zu Hauptkomponentenanalyse
Eine Forscherin untersucht den Zusammenhang zwischen Schulleistung und sozialen Faktoren. Sie hat Daten zu 8 Variablen erhoben: Mathematiknote, Deutschnote, Englischnote, Lesekompetenz, Einkommen der Eltern, Bildungsstand der Eltern, Anzahl Bücher zuhause und Wohnortgröße.
Nach Standardisierung aller Variablen führt sie eine PCA durch. Die Eigenwertanalyse ergibt folgendes Bild:
| Hauptkomponente | Eigenwert | Erklärte Varianz (%) | Kumulierte Varianz (%) |
|---|---|---|---|
| PC 1 | 3,84 | 48,0 % | 48,0 % |
| PC 2 | 1,76 | 22,0 % | 70,0 % |
| PC 3 | 0,88 | 11,0 % | 81,0 % |
| PC 4 | 0,48 | 6,0 % | 87,0 % |
Anhand des weit verbreiteten Kaiser-Kriteriums (Eigenwert > 1) behält die Forscherin die ersten zwei Hauptkomponenten. Diese erklären zusammen bereits 70 % der Gesamtvarianz. Ein Blick auf die Faktorladungen zeigt: PC 1 lädt stark auf die Notenvariablen und die Lesekompetenz – sie interpretiert diese Komponente als „schulische Leistungsfähigkeit“. PC 2 lädt stark auf Elterneinkommen, Bildungsstand und Bücherzahl – was auf den „sozioökonomischen Hintergrund“ hindeutet.
Statt mit 8 korrelierten Variablen weiterzuarbeiten, verwendet sie die zwei Hauptkomponenten als Prädiktoren in einer anschließenden Regressionsanalyse – übersichtlicher, statistisch robuster und inhaltlich gut begründbar.