告别盲目随机探索!国防科大等团队巧用“参数变化”,带强化学习走出训练深水区

导语:国防科大等团队提出PACE算法,巧用“参数变化量”为强化学习自动排课,攻克无监督环境设计难题。

欢迎来到前沿AI观察。打过游戏的朋友都体验过,真正让人欲罢不能的游戏,绝对不是那种开局就送顶级神装的割草局,也不是那种怎么挣扎都撑不过三秒的“地狱难度”,而是关卡设定刚好卡在你的操作极限边缘,让人手心出汗尝试几次后终于险胜通关的“神级节奏”。

在心理学上,这种刚好跳出舒适圈、又不至于让人崩溃的成长带被称为“最近发展区”(Zone of Proximal Development);在强化学习中,这也正是智能体磨练泛化能力的黄金训练带。

然而,给人工智能当“关卡策划”并非易事。在智能体面对训练环境动态构建的场景下,现有的无监督环境设计(Unsupervised Environment Design,简称 UED)常常处于尴尬境地。系统随机生成的关卡要么难度过低,甚至无法引起模型权重的泛化更新;要么难度直接拉满,导致智能体反复碰壁,把宝贵的训练预算消耗在无意义的噪声摸索中。究竟该怎么精准判定当前阶段哪一个关卡最值得学开发团队?这一直是强化学习课程设计的痛点。

国防科技大学数智建模与仿真国家级重点实验室的研究团队(第一作者为 2024 级博士生原方,通讯作者为曾俊杰助理研究员、李庆伦博士,联合尹全军、秦龙、沈思淇、谢毓湘、杨俊强等学者)提出了一项令人眼前一亮的成果。他们设计的 PACE(Parameter Change Environment Design)算法已被 ICML 2026 录用。PACE 跳出了传统评估指标的桎梏,巧妙地用“策略参数变化量”作为标尺,精准筛选极具训练成长价值的关卡分布。

【PACE实现高效课程学习】强化学习无监督环境设计

  • 论文链接:https://doi.org/10.48550/arXiv.2605.01358

无监督环境设计:跳出“茫然试错”与“高方差开销”的泥潭

在探讨 PACE 的创新路径前,我们需要拆解此前 UED 的评测瓶颈。传统强化学习往往依赖领域随机化(Domain Randomization,DR)来应对场景变化,但这种静态随机采样在遇到极其复杂的长时程探索任务时,效率十分低下。UED 则赋予了系统动态选择、更新并呈现关卡的能力,让环境随着智能体的成长而演进。

要实现理想的动态演进,核心在于建立一个评估关卡价值的黄金指标(Score)。之前的主流方向主要基于以下几种逻辑:

  • Regret(遗憾度):对比当前策略与最优策略在关卡中的差距。然而在大多数复杂未知的开放环境中,最优策略根本无从获取,只能依赖各种代理指标去粗估。
  • GAE(广义优势估计)与 Monte Carlo 回报:通过价值估计网络误差表现强行测量。这种指标在稀疏奖励场景或者带有物理噪声干扰的环境下表现极不稳定。
  • Marginal Benefit(边际效益):该思路最具直观性,即比较智能体在某个关卡训练前后的表现变化。但是,每一次测算都需要让新旧两次策略网络在环境中分别重新运行并收集多次交互数据(rollout)。这种极高的时间与样本开销往往限制了其在超大规模分布式训练中的落地。

如何在避开高昂额外采样开销的前提下,直接、无误差地定量出智能体有没有在一个关卡上“获得成长”?这成了摆在学者们面前最迫切需要翻越的高墙。

PACE 的核心逻辑:用策略参数空间的“位移”度量学习成效

国防科大研究团队提出了一个大道至简的解法:如果某个关卡确实促成了实际学习,那么智能体在这个关卡上进行计算优化后,其策略网络的权重和偏置参数势必会发生方向性的修正。

如果这个关卡过于简单,策略网络已经能完美通关,局部梯度更新就会极度趋近于零;如果关卡极其困难,智能体始终拿不到正向反馈,梯度则会变成无意义的剧烈震荡或者同样趋于零。只有刚好落在智能体学习边界内的优质关卡,才会让神经网络向更优方向跨出实质性的一步。

顺着这一物理规律,PACE 直接把这个参数改变量定义为筛选关卡的特征信号:

【PACE实现高效课程学习】强化学习无监督环境设计【PACE实现高效课程学习】强化学习无监督环境设计

如公式所示,常规情况下粗估模型表现的提升需要额外与环境开展数次 rollout 交互。PACE 科研人员跳出了评估策略表现的固有范式,直接对目标函数进行一阶泰勒展开,并引入沿着梯度更新一步的经典假设条件:

【PACE实现高效课程学习】强化学习无监督环境设计【PACE实现高效课程学习】强化学习无监督环境设计

经过这一数学转化,PACE 成功地证明了在梯度步长很小的区域里,一个关卡为算法模型带来的饰期望收益值,与更新一步后策略网络所产生的参数变化量平方范数成正比例函数关系。这样一来,复杂的关卡评估退化为了对参数变化范数这一现成变量的计算,从根本上绕开了昂贵、高方差的额外模拟迭代开销。

“生成-评估-重播”闭环:动态进阶的自适应教学路线图

基于全新的打分公式,团队为 PACE 设计了一套非常简明且自适应的工作机制。整个系统运行逻辑高度一致,主要由两个模块反复交替运作:

关卡评分阶段(Level Scoring),关卡生成器源源不断输出候选关卡,智能体随即在新关卡中收集运行轨迹参数。在此之后,系统进行一次快速的临时梯度优化,对比策略变化前后的参数距离,即时得出该关卡的成长性分值。在这个环节中,为了不破坏当前主智能体的训练步伐,该临时网络更新并不会直接落地覆盖主策略权重。

如果储存题目池(Level Buffer)尚未充盈,这些评过分的关卡便直接存入。若池子已满,新关卡会对池内评分最低的落后关卡实施逐出,完成平滑置换。如此一来,高成长价值的关卡会在池子内高纯度保留。

策略培训阶段(Policy Training),智能体以加权概率形式频繁提取缓冲池中的关卡进行重点突破。每一次能力的修正,都会使得先前的参数发生改变;而策略自身的发展,又反过来自动重塑了后续新生成题目的评分准则。这种策略与训练分布双向奔赴的设计,极大增强了模型收敛的整体平稳性。

实测数据解析:零样本场景和开放式任务的双重胜利

为了全面拷问 PACE 在遇到超出分布的环境时究竟具备多少抗压泛化潜力,论文作者们在 MiniGrid 结构化迷宫以及 Craftax 开放探索中开展了对比验证。

在标准的 MiniGrid 测试场景中,各方法均接受同等基础层级的训练。评估阶段,直接将智能体扔进 12 个完全没见过的、极具人类认知技巧逻辑的新关卡开展零样本泛化测试(不可微调)。在 Maze3、Labyrinth 等极度迷宫化的考验中,PACE 无论是胜出概率还是稳定性,均表现出强大的优势。

在结合 rliable 库的多角度聚合评估中,PACE 在整体性能的 IQM(四分位均值)层面上刷出了 0.964 的高水平,大幅刷新了被广泛看作行业最强基准 PLR(0.808)的成绩。同时,用于检测智能体整体表现偏科情况的 Optimality Gap 也被大幅缩减至 0.172

面对环境分布频繁在长时程中展现非平稳波动的测试大山——JAX 加速的开放型基准平台 Craftax-1B,智能体必须在 1 亿左右的环境交互资源中,在没有明确阶段引导的前提下面对持续更新的事件与物种系统。在 20 个独立、未见过的 Craftax测试关卡综合评估下,PACE 在一致的预算规模里跑出了 14.53 的平均大局回报(episodic reward),明显高于随机领域化的 5.25,同样超过了 PLR 及 ACCEL 等对比算法。

这展现了自适应课程设计领域的一种新走向:不需要为了寻找最优关卡而强硬进行多余的环境轨迹运行。仅通过智能体网络内部参数的空间动态表现这一无偏见的低方差内生信号,PACE 就能够灵巧地捕获到智能体策略的实时进展信息。这为今后应对更广泛复杂、动态变化的真实世界的强化学习泛化训练打开了更为广阔的优化思路。

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

【PACE实现高效课程学习】强化学习无监督环境设计

© 版权声明

相关文章