当AI学会“视觉规划”:EAR范式首次系统评测图像编辑模型的推理潜力
导语:图像编辑模型不仅能生成逼真画面,还可能成为视觉规划的新载体。一种全新范式EAR,正在重新定义AI的推理边界。
当谈及图像编辑模型时,人们往往聚焦于其生成能力:更清晰的画质、更精准的指令遵循。但一项由上海交通大学与北京通用人工智能研究院联合发布的研究表明,这些模型的潜力远不止于“画得好”——它们还可能具备一种更高级的能力:视觉规划。研究人员提出了一种名为“Editing as Reasoning”(EAR)的新范式,并构建了专门的评测基准AMAZE,首次系统性地探索了图像编辑模型在视觉规划任务上的表现。相关论文已被ICLR 2026 Efficient Spatial Reasoning Workshop接收。
在人类智能中,视觉规划是一项十分核心的能力。无论是玩迷宫游戏还是下国际象棋,我们往往依赖空间直觉快速完成决策。然而,当前多数机器学习模型仍依赖“语言推理”,即先将视觉问题转化为文本,再交由语言模型处理。这就引出了一个关键问题:如果不经过文本转换,模型能否直接在视觉空间中完成规划? EAR范式正是为了回答这一问题而设计的。
什么是EAR范式?
EAR的核心思想十分大胆:它要求模型直接接收一幅谜题图像(例如一个迷宫或一个皇后摆放问题),只通过一次图像编辑操作就输出最终解,将原本复杂的多步规划过程压缩为单步视觉生成。这与传统做法完全不同——以往模型要么依赖文本链式推理,要么逐步生成中间状态,而EAR则要求模型在“编辑”这个动作中一步到位地完成路径选择、冲突消解与全局协调。
为了让评测可量化,研究团队设计了两类自动指标:
- Coverage / Violation:分别衡量模型生成结果与正确解重合的比例,以及违反正确解约束的比例。
- MSE-In / MSE-Out:度量解区域内外的像素级误差。
在此基础上引入Pass@1 / Pass@5,即一次采样或五次采样的通过率,综合Coverage与Violation后判断逻辑是否有效。
图片说明:AMAZE基准中的迷宫与皇后任务示例,直观展示了EAR的单步视觉规划要求。
AMAZE基准:迷宫与皇后,两种互补的视觉规划
AMAZE基准包含两类经典任务:Maze(迷宫)和Queen(皇后),它们覆盖了互补的视觉规划模式。
迷宫任务要求模型从起点到终点画出一条合规路径,不得穿越墙壁。尺寸从3×3到16×16,并包含圆形、六边形、方形、三角形四种几何拓扑。皇后任务则是一个经典组合问题:在N×N棋盘上放置N个皇后,使它们互不攻击。尺寸从4×4到10×10。两类任务均以图像形式输入,模型需直接输出编辑后的图像,其中路径或皇后位置即为解。
测试集规模:迷宫任务2800个样本,皇后任务350个样本。
核心实验:模型会“画”,但离“会想”还有距离
零样本表现整体偏弱
前沿闭源图像编辑模型在零样本视觉规划上能力十分有限。在迷宫任务上,最佳Pass@1仅为5.40%,典型问题是经常“穿墙”。其中GPT-Image-1的Violation高达62.88%,几乎无视边界;NanoBanana-Pro虽然像素保真度最好,但会过度生成,Violation达47.76%;Seedream-4.5则倾向欠生成,Violation虽低但难以画出完整路径。在皇后任务上,只有NanoBanana-Pro表现突出(Pass@1 30.35%),其余模型几乎为零,暗示其训练数据可能包含类似任务。
扩散模型比自回归模型更适合视觉规划
通过监督微调比较两种生成范式:以扩散模型代表Bagel和自回归模型代表Janus-Pro为例。微调前两者Pass@1均为0,微调后Bagel在迷宫任务上Pass@1达到11.54%,而Janus-Pro仅1.43%;皇后任务上Bagel为14.57%,Janus-Pro为12.57%。扩散模型通过逐步去噪构建全局结构,更容易维持整体一致性;自回归模型逐token顺序生成,在需要全局协调的任务中处于劣势。这显示扩散式架构在视觉规划上具有先天优势。
思维链提示不是万能药
加入“分步思考”提示(Chain-of-Thought,CoT)后,零样本下对Bagel、Janus-Pro几乎无帮助。当模型未内化任务逻辑时,CoT无法凭空提升求解能力。微调后CoT带来边际改善:迷宫任务上Bagel的Pass@1从11.54%升至17.90%;但皇后任务上反而微降(14.57%→14.08%)。这说明CoT更像一种放大已有能力的机制,只有模型已掌握基本规划逻辑时才能生效。
扩散模型如何“规划”?——从去噪过程窥探
研究人员观察了微调后Bagel在迷宫和皇后任务上的中间去噪步。迷宫求解中,正确路径并非最后一步突然出现,而是在早期(如t=1、2、4)就以低置信度的模糊轨迹显现,随后随去噪逐步清晰,错误分支被修正,最终收敛为有效解。皇后任务则不同:模型首先生成粗糙的全局布局,再进行细粒度调整。这揭示扩散模型确实表现出某种“由粗到细”的视觉规划特征,但在皇后这类强全局约束任务上仍然不足,维持跨区域的一致性仍是薄弱环节。
泛化能力:模型能举一反三吗?
六边形训练最利于跨几何泛化
在迷宫任务中,用六边形迷宫训练的模型对其他几何(圆形、方形、三角形)的迁移效果最好。研究者推测,六边形具有更丰富的方向空间,为模型提供了更广义的“动作集合”,从而更容易学到超越单一拓扑的路径规划逻辑。
跨尺度泛化:迷宫较易,皇后更难
仅用3×3迷宫微调的模型,竟能外推到16×16迷宫,且仍表现出一定能力,说明模型学到了可复用的路径构造规律,而非死记硬背。但皇后任务仅用4×4训练时,模型无法泛化到更大棋盘;只有用更大尺度(如7×7)训练后,才出现有意义的跨尺度泛化。这反映出组合型规划对训练尺度的依赖更强。
Scaling效应:数据与算力如何影响视觉规划?
以Bagel为对象,系统考察训练样本数与训练步数对性能的影响。
数据扩展:约1600样本后饱和
固定1000步训练,样本从800增至6400。迷宫任务上,六边形迷宫的性能从65.2%升至68.1%,主要增益在800→1600,之后进入平台期。皇后任务在800→1600时性能提升高达+10.3%,对数据规模更敏感。任务结构不同,数据扩展曲线也不同:组合型任务更依赖丰富多样的解空间样本。
算力扩展:后期增益更显著
固定6400样本,训练步数从500增至1000。六边形迷宫在500–700步仅提升6.1%,700–1000步则提升15.8%,呈现非线性增长。增加训练计算在达到一定阈值后能带来更显著回报。
人机对比:模型相当于几岁孩童?
将微调后的Bagel与6岁、12岁、18岁三组人类进行对比。人类在时间增加时成功率持续上升,而模型收益有限,更像在固定能力边界内重复尝试。更值得玩味的是表现模式的相关性:在迷宫任务上,模型与12岁组最接近;在皇后任务上,却只与6岁组相似。这表明迷宫代表的局部约束顺序规划相对容易,而皇后代表的全局约束组合规划更具挑战,模型在这一维度上仍处于初级水平。视觉规划并非单一能力,而是包含局部约束处理、全局协调和长程结构推理等多个层次。
错误分析:违反约束与不完整解
模型失败主要归为两类:
- 违反任务约束:迷宫路径穿墙、越界,甚至在复杂几何中将起点终点硬连;皇后落子违反全局约束。这反映指令遵循能力不足。
- 不完整解:模型往往只生成局部正确的前缀路径或部分皇后,无法完成整体求解。这是一种保守策略,在大尺度或跨域任务中尤为常见。
当前模型主要问题在于常常停留在“局部合理、全局不成立”的阶段,而非完全无法求解。
研究意义:从多模态理解到原生视觉规划
这项工作将视觉推理的评测重心从“理解图像”推向“在图像中规划”。用抽象任务剥离复杂感知因素,使视觉规划首次作为独立能力被系统检验。Maze和Queen分别对应两种典型规划模式,而自动指标的设立让模糊的“视觉推理”变得可量化、可比较。虽然图像编辑模型已展现一定视觉规划潜力,尤其在监督微调后能实现跨尺度、跨几何泛化,但零样本下的脆弱性、强全局约束下的不足以及与人类效率的差距,都表明视觉规划并非生成能力的自然延伸,而是需要专门建模、专门训练和专门评测的核心能力。
未来,评估AI模型时,我们不仅要看它能否生成逼真图像、说出流畅解释,更要追问:它能否在图像空间中完成规划、维持约束、形成推理?这或许才是迈向真正空间智能的关键一步。