《基于时间序列分析预测的黄河水沙监测模型》
为学习ARIMA模型算法,需要在实际操作中获取经验,然而在获奖的论文中同样可以取别人之长补自己之短,本文选取“高教社杯2023年E题032队伍获奖优秀论文”
这份比赛论文(E032.pdf)在问题三中使用了SARIMA(季节性差分自回归移动平均模型)进行水沙通量趋势预测。整体来看,该论文在SARIMA的应用上步骤较为完整,但在理论细节、参数选择依据、模型验证方法等方面存在一些值得分析和改进的地方。
以下我将从建模流程、参数选择、模型诊断、预测效果、潜在问题与改进建议五个方面,系统分析该论文中SARIMA的使用情况,并结合你的学习需求给出学习建议。
目录
一、建模流程分析
1.1 优点
1.2 不足与问题
二、参数选择与模型结构
最终选定的模型
评价
三、模型诊断与验证
1. 残差白噪声检验(D-W检验)
2. 贴合度评估
四、预测效果与可视化
五、改进建(供你学习参考)
六、附件
一、建模流程分析
1.1 优点
流程清晰:
(1)数据划分:2016-2020年为训练集,2021年为测试集;
(2)平稳性检验(ADF检验);
(3)差分处理(普通差分 + 季节差分);
(4)模型识别(ACF/PACF);
(5)模型定阶(AIC/BIC);
(6)残差诊断(D-W检验);
(7)预测与可视化。
考虑了季节性与周期性:
明确使用了季节性参数
s=6(每半年一个季节周期),这与问题二中分析出的“10个月周期”略有不同,但出于建模简化是合理的。
使用热力图辅助定阶:
通过热力图展示不同参数组合的AIC值,辅助选择最优模型,增强了可解释性。
1.2 不足与问题
| 问题 | 说明 |
|---|---|
| 季节周期选择不一致 | 问题二分析出“10个月”主周期,但SARIMA中使用s=6,缺乏解释或验证。 |
| 差分次数过多 | 使用了2阶普通差分 + 1阶季节差分,可能导致“过度差分”,降低模型泛化能力。 |
| 参数选择依赖AIC,但未交叉验证 | 仅使用AIC选择最优参数,未进行交叉验证或滚动预测验证,可能过拟合。 |
| 贴合度(90%)未说明评估指标 | 未明确说明是R²、MAPE还是其他指标,且未对比基准模型(如ARIMA、指数平滑)。 |
| 预测区间未提供 | 仅给出点预测值,未给出置信区间,难以评估预测不确定性。 |
二、参数选择与模型结构
最终选定的模型
SARIMA(2, 2, 3)(0, 1, 1, 6)
| 参数 | 含义 | 取值 |
|---|---|---|
| p | 非季节自回归阶数 | 2 |
| d | 非季节差分次数 | 2 |
| q | 非季节移动平均阶数 | 3 |
| P | 季节自回归阶数 | 0 |
| D | 季节差分次数 | 1 |
| Q | 季节移动平均阶数 | 1 |
| s | 季节周期长度 | 6 |
评价
p=2, q=3表明模型考虑了前两个时刻和前三期残差的影响;
Q=1表明季节移动平均成分显著;
D=1说明季节性趋势明显;
d=2可能偏大,建议尝试 d=1 或使用KPSS检验辅助判断。
三、模型诊断与验证
1.残差白噪声检验(D-W检验)
D-W值 ≈ 2.02,说明残差无自相关,模型拟合良好。
2.贴合度评估
论文称“贴合度为90%”,但未说明是训练集还是测试集;
建议补充:
测试集上的MAPE、RMSE;
与实际2021年数据对比图;
基准模型对比(如ARIMA、ETS)。
四、预测效果与可视化
论文展示了未来两年的趋势图,指出存在季节性、周期性特征;
预测结果显示2022年有极值点,之后下降;
但未给出预测值的具体表格或置信区间,缺乏实用性。
五、改进建(供你学习参考)
| 改进方向 | 建议 |
|---|---|
| 周期性选择 | 使用周期图(periodogram)或傅里叶分析辅助选择s,而非固定为6。 |
| 差分检验 | 使用KPSS检验辅助判断差分阶数,避免过度差分。 |
| 模型选择 | 使用滚动预测验证(rolling forecast)或交叉验证选择参数。 |
| 预测评估 | 使用MAPE、RMSE、MAE等指标,并在测试集上评估。 |
| 不确定性量化 | 提供预测区间(prediction interval),增强实用性。 |
| 对比模型 | 与ARIMA、ETS、Prophet等模型对比,验证SARIMA的优势。 |
