多步预测总翻车?北大团队揪出MSE两大“原罪”,让损失函数自我进化 | ICLR 2026

导语:北大林宙辰团队提出QDF方法,颠覆传统MSE损失函数,通过元学习自适应调整预测步权重与相关性,显著提升多步时序预测性能。

在多步时间序列预测中,一个令人头痛的现象反复出现:无论模型结构如何精巧,当预测跨度从短期扩展至中长期时,误差便会急剧放大,周期和趋势逐渐偏离真实轨迹。从气象预测到金融走势,从电力负荷到交通流量,长期预测的退化似乎成了躲不开的“魔咒”。学界通常将此归咎于模型表达能力不足或依赖关系建模不完善,但北京大学林宙辰教授团队却将矛头指向了一个长期被忽视的环节——训练时使用的损失函数。在发表于 ICLR 2026 的论文《Quadratic Direct Forecast for Training Multi-step Time-Series Forecast Models》中,他们提出 QDF 方法,彻底重构了训练目标的加权结构,让损失函数从数据中自适应学习,从而在不改动模型架构的情况下,显著提升了多步预测的性能。

论文链接:https://arxiv.org/pdf/2511.00053v1

问题根源:均方误差的两个错误“先验”

当前绝大多数时间序列预测模型仍以逐时间点的均方误差(MSE)作为损失函数:

$$\mathcal{L}_{\text{MSE}} = \frac{1}{H} \sum_{h=1}^{H} (y_{t+h} – \hat{y}_{t+h})^2$$

这种形式看似简单自然,实则隐含了两个强先验假设:一是未来不同时间点的预测相互独立;二是所有预测步的重要性完全相同。

然而现实显然并非如此。明天的气温与后天紧密相关,预测未来1小时与预测1周的难度截然不同。多步预测中的不同步长既存在显著的条件相关性,又具有差异极大的不确定性。研究团队通过实验证实了这一直觉:

  • 条件独立假设不成立:对标签序列的条件协方差进行偏相关分析后发现,在控制历史输入后,未来时间点之间仍存在大量非零偏相关系数,直接否定了 MSE 的独立假设。
  • 等重要性假设不成立:分析条件方差显示,不同步长的误差方差差异巨大,且随预测步整体增大而增大,说明将所有步长等权看待不符合数据特性。

因此,长期预测产生的系统性偏差并非偶然,而是训练阶段错误假设的必然结果。要真正解决问题,必须从损失函数的源头入手,显式地对相关性和重要性差异进行建模。

QDF:从数据中“学”出最优损失函数

林宙辰团队提出的 QDF(Quadratic Direct Forecast)方法,核心突破在于将损失函数本身视为可学习的对象。他们从高斯误差假设下的极大似然估计出发,推导出理想的训练目标应为基于条件协方差矩阵的二次型损失:

$$\mathcal{L} = (\mathbf{y} – \hat{\mathbf{y}})^\top \mathbf{W} (\mathbf{y} – \hat{\mathbf{y}})$$

其中权重矩阵 W非对角元素刻画不同时间步的条件相关性,打破了独立假设;对角元素反映各步的不确定性差异,打破了等重要性假设。理论上,这一形式能够同时弥补 MSE 的两大结构性缺陷。

但困难在于 W 在实际中难以直接估计。为此,团队借鉴元学习思想,设计了一个双层优化框架:

  1. 在内层,先用当前的 W 在元训练集上更新预测模型参数;
  2. 在外层,用更新后的模型在元验证集上计算预测误差,通过反向传播更新 W

这一设计的精巧之处在于:训练目标的优劣不再由对训练集的拟合程度决定,而是由它在未见数据上的泛化性能来评判。 通过多次拆分训练集并迭代优化,算法能够自动捕捉跨时间区间的稳定误差相关模式,学到既符合统计原理又具备强泛化能力的训练目标。整个优化无需调整模型结构,仅通过改变损失即可实现。

实验结果:一致且显著的优势

论文在多个主流时序预测模型和公开数据集上进行了全面验证。与现有的损失函数改进方案(如 FreDF、Time-o1)相比,QDF 不仅带来了稳定的性能提升,而且在预测精度和长期趋势保持能力上明显占优。这些传统方法大多只部分处理标签相关性,而 QDF 同时建模相关性与重要性差异,并通过元学习获得最优权重,彻底消除了损失函数中的结构偏差。

消融实验进一步确认:单独引入步长权重或时间相关性均能带来增益,但两者协同作用时提升最为显著,证明了联合建模的必要性。

更具启发的是预测序列的可视化:基于 MSE 训练的模型在周期信号中普遍出现振幅压缩、峰值抹平、拐点响应滞后等失真;改用 QDF 后,峰值位置、周期相位和长期趋势的稳定性显著增强,时间结构得到更完整的保留。这说明 QDF 教会了模型去“尊重”未来不同时间点之间的整体关系,而非孤立地优化每个点。

一次对默认假设的系统性审判

这项研究的意义远超一个具体的损失函数设计。它首先有力地推翻了一个在时序领域长期被默认接受的假设:多步预测可视为一组独立且等权的回归任务。通过严格的概率建模与实证分析,团队系统性地论证了该假设的局限性,为理解长期预测失效提供了全新视角。

更重要的是,他们提出了一种范式转换的可能:将损失函数视为可学习的对象,而非固定不变的超参数组合。 这种“学习如何学习”的思路,突破了以往手工设计损失的局限,使训练目标能够根据数据特性自适应调整,兼顾统计合理性与泛化能力。对于后续研究,这启示我们不仅要追求更强大的模型结构,还应持续审视那些被默认接受的训练前提,并从统计建模原理出发反推优化目标的合理形式。元学习与领域统计方法的结合,或许会成为时间序列预测乃至更多领域的新突破口。

论文第一作者王浩现为浙江大学控制学院博士研究生,研究方向为因果推断、多任务学习与大语言模型。通讯作者林宙辰教授任职于北京大学智能学院,是机器学习与数值优化领域的资深学者,谷歌学术引用超42,000次,曾多次担任顶会 Senior Area Chair。该工作得到北京市科委等的大力支持。

北大林宙辰团队ICLR 2026:让损失函数从数据中学习,颠覆多步时序预测

北大林宙辰团队ICLR 2026:让损失函数从数据中学习,颠覆多步时序预测

北大林宙辰团队ICLR 2026:让损失函数从数据中学习,颠覆多步时序预测

北大林宙辰团队ICLR 2026:让损失函数从数据中学习,颠覆多步时序预测

北大林宙辰团队ICLR 2026:让损失函数从数据中学习,颠覆多步时序预测

© 版权声明

相关文章