算力节省近四成!三星北大M2RL报告终结多领域RL训练路线之争

导语:混合训练还是分训合并?三星北大M2RL报告用详尽实验给出答案:混合多任务RL不仅效率更高,域间增益也远超预期,终结了路线之争。

大模型若要真正走向通用,必须同时驾驭 Agent 交互、数学推理、代码生成、科学问答等多元能力。然而,在后训练强化学习(RL)阶段,不同领域的数据、奖励函数极易引发梯度冲突,导致模型“样样通、样样松”。近日,三星研究院联合北京大学发布技术报告《To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models》(简称 R2Mixer 或 M2RL),首次通过大规模受控实验,系统对比了“混合多任务 RL”与“先分训再融合”两大范式,并揭示了一套高效、稳定的多领域训练最佳实践。

两条主流路线,一场亟待破局的对抗

当前业界在 RL 后训练上分化出两大阵营:

  • 混合多任务范式:在同一批次中混合不同领域的数据,使用统一的奖励模型或加权奖励进行训练,追求一次训练即覆盖多元能力。
  • 专家融合范式:先在每个领域分别训练专家模型,再通过权重平均、任务算术、蒸馏等技术将多个专家的知识合并为一个通用模型。

DeepSeek-R1、Qwen3、GLM-4.5、MiMo-V2 等明星模型选择了不同路径,但对两种范式的系统对比和机理分析长期缺位。M2RL 研究正是为了回答四个核心问题:

  1. 不同领域 RL 是否会产生梯度干扰?混合训练的计算成本是否更低?
  2. 领域间是否存在知识迁移,还是互相拖累?这种关系在不同任务类型间有无差异?
  3. 模型合并后的性能增益来自何处?不同合并方法孰优孰劣?
  4. RL 训练能否赋予模型自我评判能力?这种能力在不同范式下如何演化?

M2RL 实验设计:五域覆盖,全开源可控复现

研究团队完全基于开源数据集完成完整的 SFT+RL 流程,确保结果可复现。实验选取数学、编程、科学、指令跟随与 Agent 五个典型 RLVR 域,基座模型为 Qwen3-4B-Base,RL 算法采用 GRPO

监督微调(SFT)数据配置

参照 Nemotron 3 Nano 技术报告,团队对开源数据按比例混合,总数约 1400 万条。部分大型数据集随机下采样,小型数据集最多重复使用 10 次。详细配比如下:

强化学习数据与配比

RL 训练同样使用 Nemotron 3 Nano 的开源数据,不同领域的数据来源与占比如下:

算力节省近四成!三星北大M2RL破解多领域RL训练最优解

模型融合方法对比

除了主流权重平均(Average)、任务算术(Task Arithmetic)、Ties-Merging、SCE Merging 等直接合并法外,还考察了与 DARE 的组合效果。另一条路线为多教师在线策略蒸馏(MT-OPD),用五个域专家作为教师,设计特定路由策略蒸馏到单一模型。所有实验在统一显卡环境下运行,对比了 GPU 小时消耗。

关键发现:混合训练省时省力,域间增益远超预期

在覆盖 5 个域 9 个基准(AIME’24/25、LiveCodeBench v5/v6、HLE、GPQA-Diamond、IFEval、IFBench、BFCL v3)的评测中,模型合并方案均报告 Ties-Merging 的最佳结果。主要结论可归纳为:

  • 独立 RL 专家各擅胜场:各域的专用 RL 模型在其对应 benchmark 上几乎都取得最佳。有趣的是,数学 RL 模型在科学基准上的表现甚至超过了科学 RL 模型,暗示当前科学题更多依赖逻辑推理而非领域知识。
  • 混合多任务 RL 效率惊人:仅用约 63.7% 的 GPU 小时,就能达到与先独立训练再合并相当的性能。
  • 域间干扰微弱,正向迁移显著:数学、编程、科学三个推理域的 RL 训练可以相互提升;指令跟随域的 RL 也对三个推理域有裨益。唯一例外是 Agent 域——其他域的训练对其没有增益,这可能源于单轮推理与多轮工具调用、环境交互的本质区别。但反过来,指令跟随和 Agent 域的 RL 却能提升推理域的能力,说明推理是基础技能,可被多方学习强化。
  • 免训练合并效果惊艳:Weight Merging 这类无需额外训练的方法,不仅继承了专家模型的大部分性能,在 AIME’24/25、HLE、IFEval、BFCL v3 上甚至超越了各自的专家模型,印证了不同域知识的正向叠加效应。同时,其零额外 GPU 小时成本也优于 MT-OPD。

研究还揭示了训练动态:三个推理域的 RL 过程能持续拔高彼此的性能曲线;而指令跟随和 Agent 域只有自身域的 RL 才能稳定提升,推理域的 RL 对其毫无助益;相反,指令跟随和 Agent 的 RL 却能为推理域带来一定增益,进一步验证了推理能力的基石地位。

深入机理:从信息约束到自我评判

除了性能对比,该工作还从信息约束、模型预测行为、自我验证等多个角度剖析了多域 RL 的工作机理。例如,实验发现不同的训练范式会影响模型在生成过程中的确定性以及自我修正能力。这些深入分析为更大规模模型的训练提供了关键理论指导。

工程实证:4B 模型追平官方表现

团队仅凭开源数据,从 Qwen3-4B-Base 出发,得到的模型可与官方 Qwen3-4B 相媲美,证明了整个训练框架的有效性。这为千亿、万亿参数模型的 RL 训练提供了可复用的工程方案。

该报告三位共同一作分别为三星大模型高级研究员王好庆、龙翔以及北京大学博士生李子恒;通讯作者为三星大模型算法负责人、高级技术总监唐业辉(北大博士,AI 顶会论文 50+,引用过万,担任 NeurIPS/ICML 领域主席)。

凭借三星此前向英伟达采购 5 万张 GPU 的传闻,此番基础研究的系统突破,或标志着三星正加速构建自主可控的通用大模型体系,为未来在手机、智能终端、自动化工厂等场景中的全栈 AI 部署铺路。

算力节省近四成!三星北大M2RL破解多领域RL训练最优解

算力节省近四成!三星北大M2RL破解多领域RL训练最优解

算力节省近四成!三星北大M2RL破解多领域RL训练最优解

算力节省近四成!三星北大M2RL破解多领域RL训练最优解

算力节省近四成!三星北大M2RL破解多领域RL训练最优解

© 版权声明

相关文章