Seit 2019 im DACH-RaumSeit 2019
50+ Statistik-Experten50+ Experten
Über 1.200 Projekte1.200+ Projekte
Alle StatistikprogrammeAlle Programme
Express möglichExpress

Statistik-Glossar

Hauptkomponentenanalyse

Principal Component Analysis (PCA) · Maximilian Fuchs · 24. April 2026 · 6 Min. Lesezeit

Was versteht man unter Hauptkomponentenanalyse?

Die Hauptkomponentenanalyse (kurz: HKA oder PCA, von englisch Principal Component Analysis) ist ein statistisches Verfahren zur Dimensionsreduktion. Sie transformiert einen Datensatz mit vielen Variablen in einen neuen Satz von Variablen – den sogenannten Hauptkomponenten –, der die wesentliche Streuung der Originaldaten möglichst vollständig erhält, aber mit deutlich weniger Dimensionen auskommt.

Die Hauptkomponenten sind Linearkombinationen der ursprünglichen Variablen. Die erste Hauptkomponente erklärt den größten Anteil der Gesamtvarianz, die zweite den nächstgrößten Anteil – unter der Bedingung, dass sie orthogonal (also unkorreliert) zur ersten steht, und so weiter. Mathematisch werden die Hauptkomponenten über die Eigenvektoren der Kovarianzmatrix der standardisierten Daten bestimmt.

Varianzanteil der k-ten Hauptkomponente

Dabei steht für den Eigenwert der k-ten Hauptkomponente und für die Summe aller Eigenwerte. Je höher der Anteil, desto mehr Varianz – also Information – steckt in dieser Komponente.

Einfach erklärt: Stell dir vor, du hast Daten von 50 verschiedenen Eigenschaften einer Person – Körpergröße, Gewicht, Alter, Einkommen und vieles mehr. Diese 50 Eigenschaften sind oft miteinander verwandt. Die PCA sucht nach wenigen „Oberthemen“, die die wichtigsten Unterschiede zwischen den Personen zusammenfassen – zum Beispiel „allgemeine Gesundheit“ oder „Wohlstand“. So arbeitest du statt mit 50 Variablen nur noch mit 3–5 sinnvollen Zusammenfassungen.

Warum ist die Hauptkomponentenanalyse für statistische Analysen wichtig?

In der empirischen Forschung arbeitet man häufig mit Datensätzen, die sehr viele Variablen enthalten. Das führt zu mehreren Problemen: Viele statistische Modelle reagieren empfindlich auf Multikollinearität (starke Korrelationen zwischen Prädiktoren), und mit steigender Variablenzahl wächst das Risiko von Overfitting. Die PCA kann hier auf verschiedene Weisen helfen:

  • Dimensionsreduktion: Wenige Hauptkomponenten repräsentieren den Großteil der Varianz – der Datensatz wird handlicher, ohne wesentliche Information zu verlieren.
  • Beseitigung von Multikollinearität: Da die Hauptkomponenten per Definition unkorreliert sind, können sie als unabhängige Prädiktoren in Regressionsmodellen eingesetzt werden.
  • Visualisierung: Hochdimensionale Daten lassen sich durch die ersten zwei oder drei Hauptkomponenten grafisch darstellen und explorativ erkunden.
  • Vorverarbeitung: In maschinellen Lernverfahren wird die PCA häufig als Vorverarbeitungsschritt genutzt, um Rechenaufwand zu reduzieren und Rauschen zu minimieren.
Häufiger Fehler: Die Hauptkomponenten sind statistische Konstrukte – sie haben nicht automatisch eine inhaltlich interpretierbare Bedeutung. Es ist ein verbreiteter Fehler, einer Hauptkomponente direkt eine sachliche Bedeutung zuzuschreiben, ohne die Faktorladungen sorgfältig zu analysieren. Zudem setzt die PCA voraus, dass die Variablen standardisiert sind, bevor sie auf die Kovarianzmatrix angewendet wird – sonst dominieren Variablen mit großer Skala das Ergebnis.
Gut zu wissen: Die PCA ist eine explorative Methode und liefert keine Kausalaussagen. Sie eignet sich gut zur Strukturentdeckung, sollte aber nicht mit der Faktorenanalyse verwechselt werden: Beide reduzieren Dimensionen, verfolgen aber unterschiedliche mathematische Ziele und Annahmen.

Praxisbeispiel zu Hauptkomponentenanalyse

Eine Forscherin untersucht den Zusammenhang zwischen Schulleistung und sozialen Faktoren. Sie hat Daten zu 8 Variablen erhoben: Mathematiknote, Deutschnote, Englischnote, Lesekompetenz, Einkommen der Eltern, Bildungsstand der Eltern, Anzahl Bücher zuhause und Wohnortgröße.

Nach Standardisierung aller Variablen führt sie eine PCA durch. Die Eigenwertanalyse ergibt folgendes Bild:

Tabelle 1. Eigenwerte und erklärte Varianz der ersten vier Hauptkomponenten
Hauptkomponente Eigenwert Erklärte Varianz (%) Kumulierte Varianz (%)
PC 1 3,84 48,0 % 48,0 %
PC 2 1,76 22,0 % 70,0 %
PC 3 0,88 11,0 % 81,0 %
PC 4 0,48 6,0 % 87,0 %

Anhand des weit verbreiteten Kaiser-Kriteriums (Eigenwert > 1) behält die Forscherin die ersten zwei Hauptkomponenten. Diese erklären zusammen bereits 70 % der Gesamtvarianz. Ein Blick auf die Faktorladungen zeigt: PC 1 lädt stark auf die Notenvariablen und die Lesekompetenz – sie interpretiert diese Komponente als „schulische Leistungsfähigkeit“. PC 2 lädt stark auf Elterneinkommen, Bildungsstand und Bücherzahl – was auf den „sozioökonomischen Hintergrund“ hindeutet.

Statt mit 8 korrelierten Variablen weiterzuarbeiten, verwendet sie die zwei Hauptkomponenten als Prädiktoren in einer anschließenden Regressionsanalyse – übersichtlicher, statistisch robuster und inhaltlich gut begründbar.

Dimensionsreduktion PCA Multivariate Statistik Eigenwerte Faktorladungen Multikollinearität Explorative Analyse Kovarianzmatrix

Ihr persönlicher Ansprechpartner

Maximilian Fuchs, M. Sc.

Teilen Sie uns mit, wie wir Ihnen helfen können.

  • Persönlicher Ansprechpartner
  • Schnelle Rückmeldung
  • Transparente Preise
  • Schutz Ihrer Daten

Fragen? Einfach anrufen!