算力节省近四成!三星北大M2RL报告终结多领域RL训练路线之争 三星研究院联合北大发布M2RL报告,系统性对比混合多任务RL与专家模型融合,发现混合训练可节省37%算力且域间正向迁移显著,为通用大模型RL训练提供全新范式。 AI 前沿动态# GRPO# M2RL# Qwen3 2个月前300