告别“换脸”尴尬,西交大 x A*STAR 用成对奖励建模让 AI 生成真正一致的多图!

导语:AI 生成单张美图易,但多张保持身份与风格一致却极难。西交大 x A*STARPaCo-RL 通过成对比较与强化学习,让模型学会跨图稳定生成,实现关键突破。

你是否曾让 AI 画一个角色,第一张惊艳,第二张走样,第三张彻底“换人”?或者在制作系列海报时,单张都精美,摆在一起却风格割裂。甚至只是修改衣服颜色,AI 却顺手把脸也改了。这些看似微小的不一致,在 IP 设计、品牌视觉、内容生产乃至工业医疗等场景中,往往是致命伤。核心痛点不在于单图质量,而在于多图之间无法保持稳定的一致性。

问题的根源在于,当前生成模型擅长“单样本最优”,却缺乏对跨图关系的稳定建模能力。来自西安交通大学与新加坡 A*STAR 的研究团队在 CVPR 2026 上发表的论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling》中,提出了一种范式层面的重构方案。他们并未沿用传统的单图打分或图文对齐思路,而是将一致性问题转化为“跨图比较”的学习任务,通过构建成对比较的奖励模型,让模型学会人类判断一致性时所依赖的相对关系与多维标准,并利用强化学习将这种判断能力注入生成过程,实现了从“会判断”到“会生成”的闭环。

论文地址:https://arxiv.org/pdf/2512.04784

一、从“不会判断”到“稳定生成”:一条完整的技术闭环

研究团队首先通过对比实验揭示一个关键事实:现有模型并不具备真正的图像一致性理解能力。在 ConsistencyRank 基准测试中,通用大模型 Qwen2.5-VL-7B 的准确率仅为 0.344,而传统方法 CLIP-I 和 DreamSim 分别达到 0.394 和 0.403。排序相关性指标上同样落后。这意味着强大的图文理解能力并不能直接迁移到需要综合身份、风格、逻辑等多维因素的跨图一致性判断上——一致性是一种专门能力。

基于此,团队训练了 PaCo-Reward 模型。在同一个基准上,准确率跃升至 0.449,提升超过 10%;Spearman 相关系数达到 0.288,显著优于所有对比方法,表明其排序能力更接近人类。在 EditReward-Bench 测试中,一致性指标 0.709,整体指标 0.751,不仅碾压其他开源方法,甚至逼近 GPT-5 的水平,展现出强大的跨任务泛化能力。

将这一奖励模型引入强化学习训练后,生成任务迎来质变。在 Text-to-ImageSet 任务中,一致性指标整体提升约 10.3%~11.7%,身份、风格、逻辑等多个维度都有明显改善。在 GEdit-Bench 编辑任务中,语义一致性和提示质量指标持续提升,例如在 Qwen-Image-Edit 模型上,整体分数从 7.307 升至 7.451,多语言设置下同样表现出稳定进步。这表明模型不仅提升了多图一致性,还保持了甚至提升了单图质量。

训练效率方面,低分辨率策略(512)仅需约 6 小时就达到高分辨率(1024)约 12 小时的效果,50 个训练轮次后性能基本收敛,大幅降低计算成本。训练稳定性方面,传统多奖励加权方法容易导致单一奖励主导优化,奖励比例迅速超过 2.5;而改进方法能将比例稳定控制在 1.8 以内,避免优化偏移,保持多目标平衡。

二、如何让 AI 学会“判断”一致性?构建可解释的奖励模型

整个研究严格划分为两个阶段:第一阶段教会模型判断一致性,第二阶段将判断能力用于指导生成。

1. 数据构建:从无到有创造一致性排序数据

困难在于,一致性判断缺乏现成标注数据,且主观性强、涉及多维度。团队设计了一套创新流程:首先生成约 2000 条文本 prompt,筛选出 708 条多样化的 prompt;然后利用图像生成模型为每个 prompt 生成多个内部一致的图像网格(每个网格含多张子图)。

接着是关键操作——对子图进行拆分与重组。将不同网格的子图进行重新组合,构造出大量具有不同一致性关系的图像对。这样,基于 708 个 prompt 和 2832 张图像,共生成了 33984 个排序样本。每个样本包含 1 张参考图和 4 张候选图,标柱者根据视觉一致性进行排序。6 名标注人员每人标注约 5664 个样本,完全基于人类直觉,不依赖刚性规则。

为便于模型训练,排序数据被转换为 pairwise 形式:将排序关系拆解为两两比较的样本,得到超过 54624 个图像对(其中 27599 个一致,27025 个不一致),且每个样本都配有推理解释,极大增强了数据的可解释性和泛化能力。

2. 模型设计:把一致性判断变成语言生成任务

传统方法输入图像输出标量分数,与视觉语言模型的自回归机制不匹配,且难以表达复杂判断。PaCo-Reward 反其道而行,将一致性判断建模为生成任务:输入两张图像和文本,模型输出“Yes”或“No”,并附带一段推理过程解释判断依据。

这一设计将一致性判断转化为语言生成问题,充分利用了视觉语言模型的生成能力,同时提升了模型的稳定性和可解释性。训练过程中,模型不仅学习最终判断结果,还学习推理过程,避免仅依赖表面特征。实验证明,该奖励模型在排序一致性和图像编辑任务上全面超越现有方法。

三、从“会判断”到“会生成”:强化学习驱动的一致性优化

第二阶段引入强化学习框架,基本流程为:模型输入文本,生成一组图像;PaCo-Reward 对这些图像进行评分;然后根据评分信号更新生成模型参数,循环往复。

为了提升训练效率与稳定性,团队提出两个关键优化:

  • 分辨率解耦策略:训练时使用低分辨率图像采样与优化,大幅降低计算开销(复杂度与分辨率呈平方关系),但推理时仍然输出高分辨率图像。实验表明低分辨率图像已提供足够的奖励信号。
  • 奖励平衡策略:一致性生成通常需要同时优化一致性和文本对齐等目标,不同奖励的尺度和波动可能差异显著,导致某一奖励主导训练。对此,团队对波动大的奖励进行压缩处理,使多奖励保持平衡,避免训练偏移。

最终在多种任务上验证:多图生成中身份、风格、逻辑一致性明显提升;图像编辑中能够准确完成局部修改且保持整体和谐,证明该方法在真实生成场景中切实有效。

四、范式升级:从单点生成到关系建模,AI 迈入持续创作时代

这项研究的意义远不止于技术指标。它解决了多图一致性这一长期痛点,让 AI 真正具备了连续创作能力。过去,单张美图无法直接应用于系列 IP、品牌物料或故事分镜;如今,模型能够理解并维持跨图的身份与风格,使 AI 从“能用”走向“可用”。

方法层面,它采用“比较学习”替代“直接打分”,更贴近人类的主观判断过程。模型不再只是机械优化指标,而是能够更自然地理解“像不像”“一致不一致”这类模糊概念,生成结果更符合人类预期。

训练层面,低分辨率训练与奖励平衡机制显著降低了计算成本并提升稳定性,意味着这类能力可以更快进入产品。普通用户未来或可直接在常用工具中体验到更稳定、更一致的生成效果。

更深层看,这项工作构建了一种“生成-评价”闭环。模型不再单向输出,而是能在生成过程中自我检查、自我优化。对用户而言,这意味着无需反复调整提示词,AI 可以自动修正偏差,逐步生成符合预期的内容,将使用门槛降至新低。

五、论文背后的研究者

论文共同一作是平博文和贾成铕。贾成铕是西安交通大学计算机科学专业博士研究生,导师罗敏楠教授,与常晓军教授合作研究,并即将加入腾讯混元青云计划。他曾在上海人工智能实验室担任研究实习生,在 CVPR、AAAI、ACL、IEEE TIP 等顶会顶刊发表多篇论文,并担任 NeurIPS、ICML、CVPR 等会议审稿人。研究方向聚焦视觉生成与智能体,包括一致性图像生成、视频生成以及奖励模型与强化学习在视觉生成中的应用。(个人主页:https://chengyou-jia.github.io/

通讯作者钱航薇现任职于新加坡 A*STAR 前沿人工智能研究中心(CFAR)。她主要从事多模态大语言模型、AI for Science、生成式人工智能与智能体系统、可信赖与可解释人工智能等方向的研究,在 AAAI、IJCAI、KDD 等会议及期刊发表多篇论文,并主持 A*STAR Career Development Fund 等项目。(个人主页:https://hangwei12358.github.io/

© 版权声明

相关文章