ARIMA-Modell
In diesem Beitrag
Was versteht man unter dem ARIMA-Modell?
Das ARIMA-Modell ist ein weit verbreitetes statistisches Verfahren zur Analyse und Prognose von Zeitreihendaten. Der Name setzt sich aus drei Komponenten zusammen, die gemeinsam beschreiben, wie das Modell funktioniert:
- AR – Autoregressive Teil (p): Der aktuelle Wert einer Zeitreihe wird durch eine gewichtete Summe seiner eigenen vergangenen Werte erklärt. Der Parameter p gibt an, wie viele vergangene Zeitpunkte berücksichtigt werden.
- I – Integrated / Differenzierung (d): Um eine nicht-stationäre Zeitreihe stationär zu machen, wird sie d-mal differenziert, das heißt, es werden aufeinanderfolgende Differenzen gebildet. Eine stationäre Zeitreihe hat einen konstanten Mittelwert und eine konstante Varianz über die Zeit.
- MA – Moving Average Teil (q): Der aktuelle Wert wird zusätzlich durch vergangene Prognosefehler (Residuen) erklärt. Der Parameter q bestimmt, wie viele vergangene Fehlerterme einfließen.
Ein ARIMA-Modell wird üblicherweise als ARIMA(p, d, q) notiert. Die zentrale Gleichung lässt sich in kompakter Form schreiben:
ARIMA(p, d, q) – Modellgleichung
Dabei steht für den differenzierten Wert zum Zeitpunkt t, für die autoregressiven Koeffizienten, für die Moving-Average-Koeffizienten und für den Fehlerterm (White Noise).
Warum ist das ARIMA-Modell für statistische Analysen wichtig?
ARIMA-Modelle gehören zur Standardausstattung der Zeitreihenanalyse. Sie sind flexibel genug, um eine Vielzahl realer Datenmuster abzubilden, und kommen in Wirtschaft, Medizin, Klimaforschung und vielen weiteren Bereichen zum Einsatz.
Besonders wichtig ist das Modell, weil viele Zeitreihendaten in der Praxis nicht stationär sind – sie zeigen Trends oder Schwankungen im Niveau. Klassische Regressionsmodelle stoßen hier an Grenzen. ARIMA adressiert dieses Problem direkt durch die Differenzierungskomponente.
Für die korrekte Anwendung müssen drei wesentliche Schritte beachtet werden:
- Stationarität prüfen: Vor der Modellierung wird geprüft, ob die Zeitreihe stationär ist – etwa mit dem Augmented Dickey-Fuller (ADF)-Test. Falls nicht, wird d so gewählt, dass die differenzierte Reihe stationär wird.
- Parameter bestimmen: Die Werte für p und q werden typischerweise anhand der Autokorrelationsfunktion (ACF) und der partiellen Autokorrelationsfunktion (PACF) ausgewählt, oder automatisch über Informationskriterien wie AIC oder BIC optimiert.
- Modell validieren: Nach der Schätzung werden die Residuen des Modells auf White Noise geprüft (z. B. mit dem Ljung-Box-Test). Verbleibende Muster in den Residuen deuten darauf hin, dass das Modell noch nicht optimal spezifiziert ist.
Praxisbeispiel zu ARIMA
Angenommen, du analysierst die monatlichen Passagierzahlen eines regionalen Flughafens über fünf Jahre und möchtest die nächsten drei Monate prognostizieren.
Nach einem ADF-Test stellst du fest, dass die Zeitreihe nicht stationär ist – sie zeigt einen klaren Aufwärtstrend. Eine einfache Differenzierung (d = 1) macht die Reihe stationär. Die Analyse von ACF und PACF der differenzierten Reihe legt nahe, dass ein autoregressiver Term der Ordnung 1 und ein Moving-Average-Term der Ordnung 1 ausreichend sind. Du schätzt also ein ARIMA(1, 1, 1).
| Parameter | Koeffizient | Standardfehler | p-Wert |
|---|---|---|---|
| AR(1) | 0,72 | 0,09 | < 0,001 |
| MA(1) | −0,45 | 0,11 | < 0,01 |
| Konstante | 120,3 | 31,4 | < 0,01 |
Der AR(1)-Koeffizient von 0,72 bedeutet: Ein Anstieg der Passagierzahl im Vormonat um 1.000 Personen geht im Durchschnitt mit einem Anstieg von 720 Personen im aktuellen Monat einher. Nach Prüfung der Residuen mit dem Ljung-Box-Test zeigt sich kein signifikantes Muster – das Modell ist gut spezifiziert und kann für die Prognose der nächsten drei Monate genutzt werden.