SFT与RL的协同困境,DYPO如何用「动态分诊」让模型推理再攀新阶

导语:DYPO提出一种全新后训练框架,通过动态判断样本学习阶段来调度SFT与RL,显著提升模型推理与泛化能力。

引言:当后训练的两大范式的短板开始对冲

大模型推理能力的提升,已经成为当前AI研究的核心战场。在诸多后训练技术中,监督微调(SFT)和强化学习(RL)无疑是双星闪耀。SFT收敛快、过程稳,能够高效内化高质量推理示范;RL则更具探索精神,常被寄望于驱动模型跨越分布外边界,实现真正的复杂推理。然而,一个尴尬的现实是:尽管这两股力量被无数次放在一起,它们的协同却始终停留在“将两个损失函数粗暴相加”的肤浅层面。

近期,一项名为 DYPO(Dynamic Policy Optimization)的动态策略优化方法横空出世,它并没有发明全新的损失函数,而是将优化逻辑提前了一个环节:先判断一个样本究竟处在学习的哪个阶段,再决定它该走SFT的“安全通道”,RL的“探索路径”,还是暂时按兵不动。 这篇工作不仅揭示了SFT和RL难以真正融合的深层统计矛盾,更给出了一套可落地的“分诊式”训练机制,在数学推理和分布外泛化任务上大幅超越传统管线。

DYPO动态策略优化:SFT与RL的协同新范式,推理性能大幅提升

偏差与方差的博弈:SFT和RL为何总是貌合神离?

如果把大模型后训练比喻成“教学生做数学题”,SFT和RL的差异就一目了然。SFT如同老师直接公布标准答案,学生依样画葫芦,优点是学得快、过程平稳,但极易陷入“会按套路解题,换张考卷就懵”的窘境。相反,RL则让学生反复试错,根据得分反馈自我修正,这更可能逼出真正的推理能力,但副作用是训练波动剧烈,一旦奖励信号稀疏,模型极易跑偏甚至崩溃。

从理论层面看,这正对应统计学中经典的偏差—方差矛盾

  • SFT:低方差,高偏差。 其梯度源自固定的高质量示范数据,更新噪声小、方向稳定,但天然倾向拟合示范分布,束缚了模型探索未知解的空间。
  • RL:低偏差,高方差。 通过奖励驱动试错,梯度更能反映真实策略改善方向,但受采样随机性和奖励稀疏性的影响,梯度估计方差高,导致训练过程充满颠簸。

问题的症结也正在于此。许多统一训练方法默认对每个样本一视同仁,将SFT和RL信号无差别混合。然而,实际情况中,不同样本面临的学习阶段截然不同:有些题目模型已滚瓜烂熟(全部答对),继续训练收益极低;有些题目则完全束手无策(一律失败),直接上RL也收不到有效奖励;真正值得全力优化的,恰恰是那些“会儿不全对,偶尔出错”的中间样本——它们既表明模型已触碰到能力边界,又为区分正推和谬误保留了宝贵梯度。

DYPO的核心理念由此而生:与其纠结要不要融合,不如回答该怎么为不同样本选择最合适的优化策略,在稳定与探索之间寻求动态平衡。

DYPO动态策略优化:SFT与RL的协同新范式,推理性能大幅提升

DYPO的“分诊式”设计:为每个样本匹配最适优化路径

DYPO的核心创新在于引入了一套动态路由机制。训练时,它会先让当前策略对每个问题生成一组rollout(多条解答轨迹),然后根据成功和失败的分布,将样本精准划入三类:

  • Easy样本: 一组rollout全部正确,意味着模型已充分掌握,直接跳过这些样本,避免无效更新浪费算力。
  • Hard样本: 全部失败,说明模型缺乏必要的知识根基,此时直接做RL只会引入大量噪声。DYPO对此采用多教师蒸馏,引入多个异构的教师模型,让模型学习多种合理推理轨迹的共性,而非死记硬背某个单一teacher的风格。这能大幅降低监督本身的偏差,为后续探索夯实基础。
  • Mid样本: 有成功有失败,正是模型的“学习前沿”。这类样本最适宜RL优化。但标准RL(如GRPO)梯度方差过高,更新时常剧烈震荡。为此,团队提出了组对齐损失(GAL, Group Alignment Loss):利用同一组rollout中的正负轨迹差异,显式地将模型拉向正确路径、推开错误路径。GAL并非在RL奖励外简单拼凑一个辅助项,而是充当动态方差抑制器,使得整体更新的稳定性大幅提升。

从理论上看,DYPO的设计逻辑恰好分别对冲了SFT和RL的核心缺陷:多教师蒸馏用多个teacher的投票缓解了SFT的高偏差;GAL则通过群体对比降低了RL的高方差。更重要的是,随着训练推进,DYPO能自适应地减少对离线监督的依赖,让优化过程从“老师扶着走”自然切换到“自己探索跑”,实现了类似自适应课程学习的效果。

DYPO动态策略优化:SFT与RL的协同新范式,推理性能大幅提升DYPO动态策略优化:SFT与RL的协同新范式,推理性能大幅提升

实验:不只是分数更高,而是全面压制分布外难题

研究团队在数学和逻辑推理场景下进行了全面评测。基础模型选用Qwen2.5-Math-7B和Qwen3-4B-Base,覆盖AIME 2024/2025、AMC、MATH-500、Minerva等标准ID任务,以及更具挑战性的OOD任务ARC-c和GPQA-Diamond。

结果非常亮眼。在Qwen2.5-Math-7B上,与传统SFT→RL顺序管线相比:

  • 五个复杂推理基准的平均分从47.7提升至52.5(+4.8),并非靠单一任务冲高,而是整体稳健提升;
  • OOD任务平均分更是从48.3飙升至61.6(+13.3),尤其在GPQA-Diamond这类强迁移推理场景中,DYPO取得了表中最优结果,充分说明它学到的是可泛化的推理能力,而非死记硬背的模板。

Qwen3-4B-Base上,趋势同样显著:ID平均分从56.1升至66.9,OOD从52.6升至68.5,进一步验证了方法不依赖于特定backbone的通用性。

更令人信服的消融实验显示,DYPO的提升并非依赖更强的teacher或更多数据。即便将多教师蒸馏中的第二teacher换成相对较弱的Qwen3-8B,DYPO仍能将AIME 25从22.0推高至27.8,将GPQA-Diamond从30.8拉至39.4。这证明,动态路由与低方差优化本身,才是性能跃迁的关键引擎。

DYPO动态策略优化:SFT与RL的协同新范式,推理性能大幅提升

训练过程的“稳定之锚”:从震荡到平滑的质变

除了最终分数,DYPO的训练稳定性同样可圈可点。分析显示,标准GRPO的梯度更新曲线往往伴随剧烈的锯齿状震荡,这样的颠簸不仅让训练极易发散,也令学习率调度和优化策略绑手绑脚。而DYPO的梯度轨迹要平滑得多,这源于GAL对RL高方差更新的有效约束。直观地看,DYPO就像是给原本狂野的RL探索套上了缰绳,既保留了探索动能,又避免了失控漂移。

另一个有趣的现象是,DYPO并非从一开始就强行推动模型大量探索,而是随着能力提升逐步降低对监督信号的依赖,让训练自然过渡到更依赖策略自身探索的阶段。整个过程宛如一套自适应课程:先站稳脚跟,再步步为营。这背后,样本分流的动态性与自适应性,确保了模型既能从teacher那里打好基础,又不至于沦为“副本复读机”。

结语:不是魔法公式,而是训练组织方式的重构

DYPO并非在证明SFT和RL可以一起用,而是在回答它们究竟该怎样一起用。它没有祭出又一个“把loss堆起来”的万金油,而是将优化逻辑前移一步:先诊后治,对症下药。 这种“动态分诊”思路,为后训练流程提供了一种全新的组织范式。当然,目前工作主要集中在数学与逻辑推理领域,文本创作、开放对话等场景的迁移效果有待验证;同时,为准确评估样本难度,每个prompt需要生成8条rollout,额外算力开销也需要在实际部署中权衡。但瑕不掩瑜,对于大模型推理能力的进阶之路,DYPO无疑开启了一个值得持续推进的方向。

© 版权声明

相关文章

暂无评论

none
暂无评论...