ARIMA 是时间序列预测里非常常用的模型,全名是自回归积分移动平均模型。它适合处理那种随时间变化、自身带有前后依赖关系的数据,比如每日订单量、月度销售额。用 Python 做 ARIMA 建模,核心就是先把数据变平稳,再选好三个参数,最后拟合和预测。

ARIMA 模型的基本组成
ARIMA 的写法是 ARIMA(p, d, q),三个参数含义如下:
- p:自回归项阶数,表示用前 p 期的自己来预测当前值。
- d:差分次数,把不平稳的数据做 d 次减法变成平稳序列。
- q:移动平均项阶数,用前 q 期的预测误差来修正当前预测。
用 Python 实现 ARIMA 的步骤
1. 准备数据与平稳性检验
先用 pandas 读入时间序列,再用 statsmodels 的 ADF 检验看是否平稳。如果不平稳就差分。
import pandas as pd
from statsmodels.tsa.stattools import adfuller
# 读取按日期索引的数据
data = pd.read_csv('ipipp.com/sales.csv', parse_dates=['date'], index_col='date')
ts = data['sales']
# ADF 平稳性检验
result = adfuller(ts)
print('ADF p值:', result[1])
# p值大于0.05一般被认为非平稳,需要做差分
if result[1] > 0.05:
ts_diff = ts.diff().dropna()
2. 确定参数并拟合模型
可以用自相关图、偏自相关图辅助定阶,也可以直接指定 p、d、q 试跑。
from statsmodels.tsa.arima.model import ARIMA # 假设定阶为 (1,1,1) model = ARIMA(ts, order=(1, 1, 1)) fit = model.fit() print(fit.summary())
3. 输出预测结果
用 forecast 方法得到未来几期的预测值,并简单打印出来。
# 预测接下来3期
forecast_obj = fit.get_forecast(steps=3)
mean_forecast = forecast_obj.predicted_mean
print('未来3期预测:')
print(mean_forecast)
小结
上面演示了如何用 Python 做最基础的 ARIMA 时间序列预测。实际项目中,你还需要关注残差检验、参数自动寻优以及季节性扩展(如 SARIMA)。只要掌握差分和定阶思路,就能解决大部分单变量时间预测问题。