1000万数据+统一验证框架!浙大腾讯打破图像编辑「规模-质量」魔咒,开源模型直逼闭源SOTA|CVPR 2026

导语:浙大腾讯联合发布UnicEdit-10M千万级图像编辑数据集UnicBench评测基准,用统一验证框架让开源模型编辑质量直追闭源SOTA。

如果你用过ChatGPT的图像编辑功能,那种指哪打哪的体验可能让你印象深刻。但当你转向一些开源工具时,却经常遭遇编辑不到位、对象混乱甚至画面崩坏。这不是错觉——顶尖闭源模型(如GPT-Image-1)与开源模型之间的差距正在被越拉越大,根源在于开源阵营缺少两样东西:足够多且足够好的训练数据,以及一套能全面诊断模型能力的评估系统

更麻烦的是,当前的数据生产流程就像一场“传话游戏”:一个编辑任务需要经过目标识别、分割、生成、融合等多个环节,第一步稍有偏差,后续步骤就会不断放大错误。而质量检查也往往只是走过场——要么只看图像有没有成功生成,根本不关心指令是否被正确执行;要么花大力气调整文本描述,却对图像本身的质量视而不见。此外,现有评测基准只考察“换颜色”“加物体”这类基础题,很少涉及“从空中俯瞰建筑”的空间理解题,或“将咖啡壶变为沸腾状态”这种需要常识推理的题目,评分指标也存在背景变化难以感知、风格变化被误扣分等缺陷。

针对这些痛点,浙江大学与腾讯的研究团队联合推出了两项重磅工作:包含千万级样本的高质量图像编辑数据集UnicEdit-10M,以及覆盖22类难度递进任务的综合评测基准UnicBench。他们还专门训练了一个7B参数的“严苛判官”Qwen-Verify,对所有生成数据进行后校验指令重写,从源头保证训练数据的质量。相关论文已被CVPR 2026接收,代码、数据集与基准均已开源。

一、UnicEdit-10M:千万级数据的自动化锤炼

UnicEdit-10M的构建采用了一套高效的三阶段自动化流水线,全程无需人工标注,却能产出媲美人工精挑的数据质量。

1. 指令生成阶段:让大模型出题

团队使用Qwen2.5-VL-72B模型,基于预定义的编辑分类体系,为每张图像生成3~7个不同且符合图像内容的编辑指令。这些指令不仅覆盖“把车变成红色”这样的基础属性修改,还包括“将建筑旋转为俯视视角”的空间变换,以及“让煮咖啡的壶呈现沸腾状态”的推理编辑,确保任务分布均衡。

2. 图像编辑阶段:双引擎并行执行

针对每一对<原始图像,指令>,系统同时调用FLUX.1-Kontext和Qwen-Image-Edit两款领先的开源编辑模型来生成编辑后的图像,形成初始三元组。源图像会先进行中心裁剪和缩放预处理,丢弃需要裁剪超过20%的图像以避免内容丢失,最终保留的图像中50%为1024×1024的高分辨率。

3. 后校验阶段:统一验证与指令精炼

所有合成三元组都要经过统一的后校验环节,不仅过滤失败的样本,还会优化对应的指令,使其与视觉编辑结果严格对齐。这一阶段的核心就是Qwen-Verify——一个基于Qwen2.5-VL-7B专门微调的双任务专家模型。

二、Qwen-Verify:细粒度质量守门人

传统的质量检查依赖SSIM等像素级指标,无法理解语义变化,常常将微小的生成噪声误判为编辑,或者对真正的幻觉编辑视而不见。Qwen-Verify则通过两个关键任务实现语义级质量把控:

  • 编辑失败检测:能细粒度识别出“未编辑”“幻觉编辑”(即生成的物体不存在)等失败情况,即便图像整体观感相似,也能准确捕捉到指令与结果的不一致。
  • 指令重写:当编辑结果与原始指令存在语义偏差时,自动重写指令,使其与实际的视觉变换精确匹配,避免训练模型学到错误的对齐关系。

对比实验显示,Qwen-Verify在正常编辑、无编辑、幻觉检测三项准确率上均显著优于Qwen2.5-VL-7B和72B基座模型。以人脸一致性为例,UnicEdit-10M的一致性得分达到0.89,而GPT-Image-Edit-1.5M仅为0.3025,展现出在保留主体细节上的巨大优势。

三、UnicBench:22类任务的全面体检

为了全面衡量模型的编辑能力,研究团队构建了UnicBench综合基准,覆盖基础编辑、几何空间变化以及基于推理知识的编辑共22类任务。基准的构建采用“VLM生成+人工审核”模式:Qwen2.5-VL先生成候选指令,人类专家再逐条审核,移除模糊或语义不一致的提示,并重写以匹配特定类别,每类包含50个测试用例。

UnicBench引入了四项细粒度指标:

  • 指令遵循度(IF):跨模态对齐分数,衡量编辑图像满足指令的程度。
  • 非编辑一致性(NC):评估非目标区域的保留情况,对意外改动进行惩罚。
  • 视觉质量(VQ):综合考量自然度、连贯性与风格一致性。
  • 推理准确性(RA):针对推理任务,VLM基于人工核验的推理要点列表进行对比打分,衡量模型是否真正执行了逻辑推理。

四、开源模型逆袭:性能直逼闭源SOTA

团队使用UnicBench对主流模型进行了全面评测,结果令人振奋:

  • 闭源模型仍占优:GPT-Image-1在英文和中文任务上均取得最高综合得分,展现出最强的通用编辑能力。
  • 开源模型迅速追赶:Qwen-Image-Edit位居开源榜首,尤其在属性编辑和对象编辑上与闭源模型的差距显著缩小,证明了大规模高质量数据与精细验证的有效性。
  • 推理编辑仍是短板:所有模型在推理准确性(RA)指标上均出现明显下滑,表明需要复杂逻辑或世界知识的编辑任务仍是行业普遍难题,也为未来研究指明了方向。

这项研究不仅为图像编辑领域提供了堪比“教材+考试”的标准化资源,更揭示了数据质量与评测全面性对于大模型能力的决定性影响。随着UnicEdit-10M和UnicBench的开源,开源社区的图像编辑能力有望迎来新一轮飞跃。

© 版权声明

相关文章