扩散模型「奖励作弊」顽疾有解!港大提出GDRO,离线训练效率飙升数倍 | CVPR 2026 香港大学赵恒爽团队在CVPR 2026提出GDRO,一种针对扩散模型的组级奖励优化后训练方法,能有效避免奖励作弊并大幅提升训练效率。本文详细解读其原理、实验结果及团队信息。 AI 前沿动态# CVPR 2026# GDRO# 奖励作弊 2个月前270