告别生成图崩坏!中科大开源 Flow-OPD,手把手教你0成本搞定多专家蒸馏

导语:文生图模型训练老是顾此失彼?中科大等机构开源 Flow-OPD 框架,用多教师蒸馏秒杀跷跷板效应!

训练文生图模型时,想要同时搞定文字渲染和基础画质,却总是陷入“顾此失彼”的跷跷板效应?中科大联合小红书等机构开源了 Flow-OPD 框架,首次把在线策略蒸馏(OPD)引入流匹配模型,帮你打造不用妥协的通才模型。

👇 三大开源传送门直达 👇
• 项目主页:https://costaliya.github.io/Flow-OPD/
• 代码仓库:https://github.com/CostaliyA/Flow-OPD
• 论文地址:https://arxiv.org/abs/2605.08063

一、为什么传统的 GRPO 训练会失效?

  • 单目标任务退化:只针对单一任务训练,会导致非目标领域的对齐能力严重倒退,甚至出现“奖励黑客”现象。
  • 异构任务冲突:如果直接混合多个奖励指标进行联合优化,异构梯度会发生参数内耗。每引入新指标,此前学会的能力就会被遗忘。

二、Flow-OPD 精排实操三步走

  1. 第一步:培育专家教师。先使用单奖励 GRPO 针对特定任务(比如文字渲染或基础画质)单独训出各领域的“专家模型”。
  2. 第二步:学生模型冷启动。通过监督微调(SFT)或模型融合,让学生模型初步具备模仿教师的能力,加速收敛。
  3. 第三步:多教师 OPD 实时蒸馏。把任务分派给专业教师。在学生模型生成图像的每个轨迹步骤上,计算学生和教师速度场的均方误差(替代 KL 散度),使用 PPO-Style 进行参数更新。

三、质量保障:流形锚点正则化(MAR)

为了防止高频优化导致图像背景崩塌,Flow-OPD 引入了 MAR 机制:

  • 接入一个冻结的美学教师模型,提供高保真的 KL 正则化监督。

  • 在维持生成图像多样性的同时,确保语义精准遵循,显著提升图像视觉质量与人类偏好对齐度。

© 版权声明

相关文章