Sutton团队新论文破解流式强化学习难题:一个1967年公式,让AI“边做边学”更稳定
导语:Sutton团队用“意图更新”重塑流式强化学习步长。

强化学习长期被认为是最接近“在行动中学习”的人工智能方法之一:智能体与环境交互,获得反馈,再根据反馈改进策略。但进入深度神经网络时代后,一个尴尬问题逐渐暴露出来——许多深度强化学习算法并不能真正稳定地“边走边学”。一旦去掉经验回放缓冲区,把批量大小设为 1,训练过程往往迅速崩溃。
2024 年底,阿尔伯塔大学 Mahmood 团队的一篇论文《Streaming Deep Reinforcement Learning Finally Works》(arXiv:2410.14606)将这一现象称为“流式壁垒”(stream barrier)。他们提出的 StreamX 系列算法依靠稀疏初始化、精细超参数和多种稳定化技巧,首次较系统地越过了这堵墙。如今,同一研究脉络又给出了一个更简洁也更根本的解释:问题未必出在数据不够多,而可能是传统学习率的“单位”选错了。

- 论文标题:Intentional Updates for Streaming Reinforcement Learning
- 论文地址:https://arxiv.org/pdf/2604.19033v1
- 代码库:https://github.com/sharifnassab/Intentional_RL
流式强化学习为什么容易崩?关键在“步长失控”
传统梯度学习通常通过学习率来规定参数每次移动多少。这个设定在大批量训练中相对可靠,因为大量样本的误差会被平均,极端梯度的影响会被稀释。但在流式强化学习中,每一步只来自一个样本,几乎没有“平均”来吸收波动。此时,梯度的方向和幅度都可能剧烈变化,导致一次更新过猛,下一次又更新不足,模型在过冲与欠冲之间震荡。
可以用开车来类比:如果教练只告诉你“每次踩油门 0.1 秒”,在平路、上坡、下坡、满载或空载时,汽车实际前进的距离都会不同。强化学习里的固定学习率也是类似逻辑:它控制的是“踩油门多久”,却没有直接控制模型输出到底变化多少。在批量训练中,这个问题可能不明显;但在每次只看一个样本的流式设置下,失控就会被放大。
这也是论文作者提出新方法的出发点:与其指定参数要移动多远,不如直接指定函数输出应该改变多少。也就是说,让每次学习都有一个明确的“意图”。
从1967年的NLMS到深度强化学习:把“意图”写进更新规则
这篇论文的核心概念被称为“意图更新”(Intentional Updates)。它并不是凭空出现的,而是继承了自适应滤波领域的一个经典思想。早在 1967 年,日本学者 Nagumo 和 Noda 就在《A learning method for system identification》中提出了归一化最小均方差算法(NLMS)。NLMS 的本质是根据期望输出变化反推更新幅度,而不是只用固定学习率去推动参数变化。
过去,这一思想主要适用于较简单的线性场景。Openmind 研究院的 Arsalan Sharifnassab,与阿尔伯塔大学 Mohamed Elsayed、A. Rupam Mahmood、Richard Sutton 等研究者此次将其推广到了深度强化学习中。
“意图更新”的基本逻辑可以概括为:每次更新前,先定义“这一步想实现什么”,再根据当前梯度对输出的影响力,反推出合适的步长。论文中的核心公式可以理解为:步长 = 期望输出变化量 / 梯度方向对输出的实际影响力。
价值学习:让预测误差按固定比例缩小
在价值学习中,智能体的目标是预测未来奖励。论文给出的“意图”是:每次更新后,当前状态的价值预测误差应缩小一个固定比例,例如 5%。这样一来,更新就不再是“参数走多远算多远”,而是围绕明确的预测改善目标展开。
如果当前参数区域很陡,梯度范数较大,算法就自动减小步长;如果当前区域较平,算法则增大步长。最终目的都是让价值函数每次受到的冲击保持可控,而不是随着样本和梯度剧烈波动。
策略学习:限制动作概率每一步的变化幅度
在策略学习中,智能体要决定做什么动作。论文将“意图”定义为:当前动作的选择概率每一步只改变一个适度量。这个变化量与优势函数相关——如果某个动作明显好于平均水平,策略就朝更偏向该动作的方向移动;如果动作表现较差,策略就减少选择它的概率。
为了避免尺度长期漂移,研究者还引入跑动平均来归一化量级,使策略更新保持在可解释、可控的范围内。
Sutton参与署名:强化学习奠基者继续押注在线学习
论文作者之一 Richard S. Sutton 是强化学习领域的标志性人物。他提出或推动了时间差分学习(TD learning)、策略梯度(policy gradient)等现代强化学习核心框架,并与 Andrew Barto 合著了经典教材《Reinforcement Learning: An Introduction》。2024 年,Sutton 与 Barto 共同获得图灵奖,获奖理由正是“为强化学习奠定了概念与算法基础”。
此次论文来自 Sutton 参与创立的 Openmind 研究院与阿尔伯塔大学团队的合作。Openmind 研究院强调资助面向基础问题的年轻研究者,而这篇论文聚焦的正是强化学习中非常根本的一件事:学习率究竟应该如何定义,才能让智能体真正持续、稳定地在线学习。
值得注意的是,论文一作 Sharifnassab 此前在 ICML 2025 发表过 MetaOptimize 框架,研究如何在线自动调整学习率。这与“意图更新”的方向高度一致:让步长不再只是人工调参的超参数,而成为可以根据学习目标自动确定的量。
算法设计:核心思想简单,落地为三类方法
尽管论文讨论的是流式深度强化学习这一复杂问题,但算法思想并不繁琐。研究者在核心“意图缩放”之外,结合了两类常见工程技术:一是 RMSProp 风格的对角缩放,用来处理不同参数维度上的量级差异;二是资格迹(eligibility traces),用于帮助奖励信号向过去时间步传播。
最终,论文形成了三类完整算法:
- Intentional TD(λ):用于价值预测任务,目标是让价值误差以可控比例缩小。
- Intentional Q(λ):用于离散动作控制任务,可对应 Atari、MinAtar 等游戏环境。
- Intentional Policy Gradient:用于连续控制任务,适合机器人仿真等场景。



实验结果:批量为1、无回放缓冲区,也能接近主流强基线
论文在多个标准基准上验证了方法效果。在 MuJoCo 连续控制任务中,包括 Ant、Humanoid、HalfCheetah 等复杂机器人仿真环境,Intentional AC 在严格流式设置下运行:批量大小为 1,没有经验回放缓冲区。即便如此,它的最终性能多次接近甚至比肩 SAC。
SAC 是当前连续控制任务中的强力基线,通常依赖大批量更新与回放缓冲区。相比之下,Intentional AC 的计算效率非常突出:论文报告显示,每次 Intentional AC 更新所需的浮点运算量约为一次 SAC 更新的 1/140。这意味着它不仅关注性能,也更适合资源受限或必须实时在线学习的场景。
在 Atari 和 MinAtar 等离散动作游戏上,Intentional Q-learning 的表现同样接近使用回放缓冲区的 DQN。更重要的是,研究者使用同一套超参数跑通全部任务,而不需要针对每个环境逐一调参。这对于强化学习而言并不容易,因为该领域长期面临算法对超参数高度敏感的问题。
“意图”是否真的实现了?论文给出定量验证
研究者还专门检查了算法是否真的做到“说好更新多少就更新多少”。他们测量实际更新量与预期更新量的比值。在禁用资格迹的简化设置下,这个比值的标准差仅为 0.016 到 0.029,99 分位数均在 1.07 以内。换言之,在绝大多数情况下,算法实际产生的输出变化非常接近预设意图。
消融实验也显示,“意图缩放”是方法的主要贡献。去掉 RMSProp 归一化或 σ 项后,性能会下降,但仍具有竞争力;而意图缩放本身对稳定性和最终表现的贡献最关键。
论文还比较了该方法对外部稳定化技巧的依赖程度。当研究者逐一移除 StreamX 方法中常用的辅助组件,例如稀疏初始化、奖励缩放、输入归一化、LayerNorm 等,Intentional AC 的性能退化小于原始 StreamAC。这说明它可能从更新规则层面缓解了流式学习的不稳定,而不是单纯依靠额外技巧“补救”。
尚未解决的问题:策略学习中的步长偏差
论文并没有回避方法局限。在策略学习中,步长会依赖当前采样动作,这可能隐式地给不同动作分配不同权重,从而改变策略梯度的期望方向。研究者通过测量期望更新方向的余弦相似度来分析这一问题。
在 Humanoid 和 HumanoidStandup 任务中,这种偏差在关键学习阶段的相似度接近 0.96,几乎没有明显影响;但在 Ant-v4 中,对齐度中位数降至 0.63,说明问题并非总能忽略。作者认为,未来需要寻找与动作无关的步长选择策略,让“意图更新”在期望意义下也保持无偏。
为什么这件事重要:让AI真正具备持续适应能力
当前主流大模型训练依赖海量数据和大规模算力,通过批量方式反复学习文本、代码和多模态数据。这一路线已经非常成功,但它本质上仍是“先学后用”:模型训练完成后通常会冻结,无法从每一次真实交互中持续低成本地更新自己。
流式强化学习追求的是另一种路线:不依赖庞大回放缓冲区,不依赖密集的大批量训练,而是把每一步经历立即转化为参数更新。这种机制更接近人类和动物的学习方式,也更适合机器人、边缘设备、长期在线系统等需要持续适应环境变化的应用。
从 2024 年 StreamX 系列算法“终于跑通”流式深度强化学习,到如今“意图更新”进一步解释并缓解步长失控问题,这一方向正在迅速成熟。它未必会取代大模型的批量预训练范式,但在需要实时、低成本、长期适应的智能系统中,流式强化学习的价值正在变得更加清晰。
这篇论文最有启发性的地方在于:学习率不只是一个需要反复试错的超参数,它也可以表达智能体每一步“想改变多少”的承诺。当这个承诺变得可控,在线学习就有机会从脆弱的实验技巧走向更可靠的基础机制。