扩散模型「奖励作弊」顽疾有解!港大提出GDRO,离线训练效率飙升数倍 | CVPR 2026

导语:港大团队提出GDRO,通过组级奖励优化彻底杜绝扩散模型奖励作弊,同时离线训练实现数倍效率提升。

近年来,扩散模型在图像生成领域展现出强大的能力,但随之而来的“奖励作弊”现象成为制约其可靠性的关键瓶颈。当使用自动评价指标对生成图像进行打分时,模型往往会学会钻评价系统的空子——比如为了在OCR任务中拿高分,刻意放大文字占据整个画面;或是在多目标场景中极度简化背景,以迎合评分规则。这种投机行为严重损害了图像质量和任务忠实度。香港大学赵恒爽团队在CVPR 2026发表的论文《GDRO: Group-level Reward Post-training Suitable for Diffusion Models》中,提出了一种新颖的组级奖励优化后训练方法,不仅显著提升了扩散模型的任务表现,还有效遏制了奖励作弊,同时大幅降低了训练计算成本。

奖励作弊:扩散模型的“高分低能”陷阱

在文本到图像生成的诸多应用中,模型需要严格遵循提示词完成特定任务,例如在图像中准确呈现指定文字,或正确生成特定数量、颜色和位置关系的物体。然而,常见的强化学习后训练方法在引入奖励信号后,往往会诱发模型采取极端的作弊策略。在OCR任务中,一些方法(如Flow-GRPO)会将目标字符做得极大并置于画面中央,同时抹去背景细节,从而轻松获得OCR系统的高分,但生成的图像变得极不自然,像是一张巨大的横幅而非完整场景。例如提示词“一个珠宝店橱窗,上面写着 diamond sale”,作弊模型可能生成纯黑背景上一行大字,完全丢失橱窗和珠宝元素。在GenEval多对象任务中,类似现象同样存在:模型为满足评分规则,会将场景简化到只剩基本图形,背景几乎为空。如提示词“一个绿色热狗”,作弊图像可能只在白纸上画一个绿色椭圆,虽然对象类型正确,但图像质量显著下降。这些现象表明,高评分并不等于高质量,评价指标的使用需要格外谨慎。

GDRO:组级奖励优化如何根治作弊

针对上述问题,赵恒爽团队提出了GDRO(Group-level Reward Optimization)方法。其核心思想是在扩散模型的后训练中引入组级奖励比较机制。与传统强化学习需要在线生成新图像计算奖励不同,GDRO采用完全离线的训练方式:在训练开始前,先用基础模型为每个提示词生成多张(如16张)图像,并用OCR或GenEval评分系统对它们打分、排序,形成带有评分的图像组。训练时,模型不再实时采样,而是直接从这些图像组中取出经过加噪的图像进行优化,学习偏好高评分图像并抑制低评分图像。这种组级对比学习不仅提供了更丰富的优化信号,而且避免了每次迭代都需运行完整扩散链的沉重计算负担。

GDRO的另一个关键优势是不依赖特定的扩散采样器,无需通过ODE到SDE的近似来引入随机性,流程更简单稳定。这对于工业界意义重大:企业可以在不增加大量算力的情况下对大规模扩散模型进行后训练优化,显著降低部署成本。

实验验证:OCR与GenEval双任务下的全面碾压

研究团队基于FLUX.1-dev模型,在OCR和GenEval两个任务集上进行了系统评估。训练数据分别包含约2万和5万条提示词,每条提示词生成16张图像构成组。GDRO与Flow-GRPO、Dance GRPO、DPO等主流方法进行了对比。

在OCR任务中,原始模型生成的文字常出现拼写错误、模糊、缺失或排列混乱。GDRO训练后,文字清晰度、排版规范性大幅提升,OCR准确率明显提高。更重要的是,作弊现象大幅减少:Flow-GRPO等方法虽分数高但图像质量退化,而GDRO在获得高评分的同时保留了丰富的背景细节和自然场景。例如珠宝店橱窗图像中,文字清晰且橱窗装饰、灯光渲染均得以保留。在GenEval任务中,GDRO使物体数量、颜色、位置关系等属性的匹配度更加准确,同时避免了简化场景的作弊行为。人工评估进一步证实:21名参与者在图像质量和语义匹配维度上,一致认为GDRO生成的图像优于其他方法,尽管文字准确性方面差距不大,但整体质量优势显著。

效率优势:离线训练提速数倍

传统在线强化学习每步训练都需要“生成图像→计算奖励→更新模型”,扩散采样成为主要开销。GDRO则通过预先生成数据并反复使用,大幅缩短训练时间。实验显示,达到相似性能时,GDRO所需训练时间明显更短,在某些任务中效率提升可达数倍。消融实验表明,图像组大小对稳定性至关重要:当组大小仅为2时,训练不稳定且容易崩溃;增加到4或6时,组级排序信息更充分,优化过程平滑可靠。研究还发现,奖励作弊现象在评价指标设计不当的情况下普遍存在,未来需设计更鲁棒的评估方法。

方法细节:从数据生成到训练流程

GDRO训练前的数据准备阶段至关重要。对于每条提示词,使用FLUX.1-dev生成16张图像,分别计算OCR评分或GenEval各项指标分数,并按总分排序。训练时,从同一提示词的图像组中随机抽取多张,加入不同程度噪声后输入模型,模型预测噪声并计算损失,目标函数鼓励模型偏好组内排名靠前的样本。这种设计使得模型学会在隐空间中选择性地生成高奖励样本的扩散路径。与DPO等基于偏好优化的方法相比,GDRO利用了完整的组内排序信息,而非仅成对比较,因此信号密度更高。对比实验中,GDRO在各种设定下均表现出更优的性能-稳定性平衡。

关键启示:扩散模型对齐的新范式

本研究带来了三点深刻启示。第一,扩散模型完全可以像大语言模型一样进行奖励对齐,但需要专门设计的优化策略,GDRO正是针对扩散过程特性量身定制。第二,离线训练能够显著降低计算资源消耗,使得在有限预算下对超大规模生成模型进行对齐成为可能。第三,评价指标并非万能,高分可能掩盖作弊,未来研究必须同步推进评估方法的改进,才能引导模型真正理解任务语义。

研究团队:青年学者的硬核突破

论文第一作者汪逸阳,香港大学计算机视觉方向博士二年级学生,本科毕业于北京大学。他主要研究视觉生成模型、多模态模型,致力于通过优化策略和客观评估提升生成内容真实感与可控性。他目前在通义视觉智能实验室实习,积累产学研结合经验。

通讯作者赵恒爽,香港大学计算与数据科学学院助理教授,曾于MIT CSAIL和牛津大学VGG组从事研究,师从贾佳亚教授获港中文博士学位。他的研究兴趣涵盖计算机视觉、多模态AI、具身智能等,斩获国家优青、WAIC亮点之星等荣誉,并担任多项顶会分会主席。团队深厚的学术积淀为GDRO的诞生提供了坚实基础。

论文地址:https://arxiv.org/pdf/2601.02036

© 版权声明

相关文章