TGO:告别「成对偏好」,ICML’26新范式让视觉生成直接用标量分数对齐
导语:生成模型对齐不再需要成对偏好?ICML’26新工作TGO利用标量分数直接优化,让视觉生成模型从真实反馈中学习更简单高效。
生成模型的偏好对齐,可能正在进入一个全新的阶段。过去几年,大模型后训练(post-training)的主流范式是让模型从“成对偏好”中学习,无论是经典的RLHF还是风靡一时的DPO,都依赖同一个前提——反馈必须成对出现。但现实中,大量反馈其实是单个样本的标量分数(scalar score),例如点赞、评分、停留时长或自动化指标。打破这一约束,已成为下一代对齐技术的关键突破口。
在这一方向上,新加坡国立大学团队提出了一种名为Threshold-Guided Optimization (TGO) 的方法,直接利用独立样本的标量评分进行对齐,无需构造偏好对。该工作已被ICML 2026接收,为视觉生成模型提供了一条更简洁、更贴近真实反馈的对齐路径。
DPO的优雅,源自pairwise data
DPO之所以能成为偏好优化的代表方法,核心在于它巧妙地绕开了KL正则化强化学习目标中难以计算的配分函数(partition function)。其数学结构非常清晰:在KL正则化对齐目标下,最优策略存在闭式解,但该解包含一个对全体输出求和的归一化项,通常不可计算。DPO的关键洞察在于,当同一提示下同时拥有一个“更好”样本和一个“更差”样本时,两者奖励之差恰好能抵消配分函数,从而将问题转化为简单的二分类问题。
然而,这种简洁性高度依赖于成对比较的数据结构。一旦监督信号不再是pair,而是单个样本的标量分数,那种依靠“两两相减”来消除配分函数的技巧就不再直接成立。实践中,常见的变通手段是将标量分数硬转为偏好对,例如在批次内排序,把高分样本当作winner,低分样本当作loser;或者对同一提示下的多个生成结果进行两两比较,构造chosen/rejected对。
这种做法虽然能用,但会带来信息损失。一个9.5分样本和一个7.5分样本,在pairwise训练里可能都只是winner;而一个4.9分样本和一个4.8分样本,也可能被强行拆为一对winner和loser。当分数差距很小且评分噪声较大时,这种人为构造的偏好对并不可靠,甚至可能放大错误监督。对于视觉生成任务而言,这一问题更为突出——图像和视频质量很少是简单的二元判断,连续分数比winner/loser标签更接近真实反馈。
三条路线,都在放松pairwise约束
TGO并非孤立的探索。近期领域内连续几篇工作都在回应同一个问题:偏好优化能否不再强依赖成对偏好?
首先是Google DeepMind发布的《Preference Optimization as Probabilistic Inference》一文(PMPO)。它指出模型并不一定需要严格配对的preferred/dis-preferred样本来学习偏好,只要存在正、负样例,甚至只有其中一种,也可以进行优化。
PMPO基于EM方式的策略改进,将目标拆解为三部分:提高正样本的似然、降低负样本的似然,同时保持与参考策略的接近。其核心优势在于反馈结构更灵活——允许正负样本不成对出现,也允许数据分布不平衡。这更贴合真实场景:我们往往只知道“这个结果不错”或“这个结果不行”,而非完整的两两对比。
另一篇工作《Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions》(QRPO)则从另一个角度切入:如果手里握有逐点的绝对奖励值,能否直接做策略拟合?
QRPO的做法是将原始奖励转换为分位数奖励(quantile reward),使得在参考策略下,分位数奖励服从均匀分布,配分函数由此获得解析形式。最终模型只需一个简单的点向回归目标,直接拟合KL正则化目标下的最优策略,不再依赖成对比较。
TGO与这两项工作瞄准同一片战场,但选择了不同的战术:PMPO关心不成对的正负反馈,QRPO试图解析化逐点绝对奖励,而TGO则面向视觉生成模型,提出了一套更轻量的阈值方案。
TGO的核心:用阈值近似baseline
TGO并非简单地拍一个阈值做二分类。它的推导源自KL正则化对齐目标,该目标指出:对于一个给定样本,最优策略应当提高其概率还是降低其概率,取决于其奖励是否超过某个与实例相关的 oracle baseline。这个baseline与配分函数有关,通常不可直接计算。
DPO通过成对比较让它抵消,QRPO通过分位数变换使它可解析,而TGO选择用数据驱动的全局阈值来近似它。具体而言,TGO从带评分数据集的分值分布中估计一个阈值,最常见的选择是百分位数阈值(如中位数)。所有分数高于阈值的样本被视为伪正例(pseudo-positive),低于阈值的样本被视为伪负例(pseudo-negative)。训练时,模型调整自己相对于参考模型的log-likelihood ratio:对伪正例提升,对伪负例压低。
更进一步,TGO引入了置信度加权(confidence weighting):分数越远离阈值,表明该样本被判为正例或负例的置信度越高,其对训练的贡献也越大;分数接近阈值的样本则更加模糊,权重更低。这样,标量分数的幅度信息并没有被完全丢弃,而是转化为了监督强度。换句话说,阈值决定更新方向,距离决定更新力度。这也正是TGO与普通二值化的关键区别。
值得注意的是,TGO并不消除对反馈质量的依赖:标量分数仍需与目标偏好足够相关。如果打分器存在偏差或噪声较大,阈值产生的伪标签也会继承这些偏差。因此,TGO解决的是如何更直接地利用标量反馈,而非替代反馈建模本身。
视觉生成:更自然的标量反馈场景
在语言模型中,成对偏好往往比较自然,人类比较两个回答的好坏有时比直接打分更稳定。但在视觉生成中,情况不尽相同。一张图片的好坏,往往不是简单的“胜过另一张”就能概括:它可能审美上出彩但文本对齐稍弱,也可能语义准确但构图平庸,更不用说风格、色调、姿态等主观维度。将这些因素叠加,连续分数(或多维度评分)比一个winner/loser标签更贴近真实偏好。
视频生成更是如此。除了单帧质量,还需考虑运动合理性、时间一致性、主体稳定性、镜头变化等,强行压缩成对偏好会损失大量细节。而在实际产品中,用户反馈也大多是标量或隐式信号——点赞、收藏、点击、停留、评分,甚至二次编辑。这些信号并不天然成对,却是模型改进的宝贵数据。如果对齐方法只能处理winner/loser,便无法充分利用这类反馈。
TGO恰好填补了这一缺口:它不要求每个提示下都有多个候选结果,也不要求人为构造偏好对,只要每个样本带有一个分数即可参与训练。这使视觉生成模型的对齐更接近真实反馈的收集方式。
实验:从扩散模型到掩码生成,全面验证
论文的实验覆盖了两类主流视觉生成范式:一类是基于扩散的模型(如Stable Diffusion v1.5、FLUX、Wan 1.3B),另一类是掩码生成模型(如Meissonic这类masked generative transformer)。TGO既可结合扩散模型的MSE式目标,也可基于token似然训练离散生成模型,展现出较强的通用性。
在图像生成任务中,TGO在Pick-a-Pic、PartiPrompts、HPSv2等测试集上,以HPSv2.1、PickScore、ImageReward、CLIPScore、LAION Aesthetic Score等多个奖励模型作为评价指标,与SFT、CSFT、AlignProp、Diffusion-DPO、Diffusion-KTO、DSPO等方法进行了对比。结果显示,TGO在多数设置下均能获得更高的奖励模型分数。更重要的是,它在多个不同奖励模型上都表现出提升,说明其并非单纯过拟合某个特定打分器,而是在更广泛的视觉偏好维度上带来了真实改善。
在视频生成上,TGO-LoRA被应用于Wan 1.3B配合VideoReward的实验设置。结果不仅整体VideoReward分数得到提升,多个组件指标也均有改善,表明threshold-guided标量反馈有望扩展至视频生成领域。
结语:不是替代DPO,而是补充新接口
TGO并不试图否定DPO。成对偏好在许多任务中仍然是最稳定、最直观的反馈形式,尤其当人类难以给出绝对分数但能清晰比较两个结果好坏时,pairwise preference仍有很强的实用价值。但问题在于,pairwise preference不应该是唯一接口。TGO的意义在于为生成模型对齐补上一种新的反馈接口——让那些天然以标量形式存在的监督信号,能够被更直接、更高效地利用。当生成模型的对齐不再被“非得成对出现”所束缚,更多真实世界的反馈才能真正流入模型优化的闭环。