CVPR 2026|何恺明团队五连发:单步生成FID 1.72、归一化流加速700倍,流匹配全面挑战扩散霸权

导语:何恺明团队CVPR 2026五连发,用流匹配、归一化流加速和纯视觉推理等技术,全面挑战扩散模型统治地位,多项核心指标超越蒸馏方法,预示着生成范式重大转变。

2025年到2026年的生成式AI领域,流匹配(Flow Matching)正在成为最受瞩目的技术方向。它用一种常微分方程路径替代扩散模型的随机微分方程路径,理论上能让图像生成摆脱数百步迭代的束缚,实现更高效的采样。但从理论到工程落地,训练目标设计、架构选择、速度与质量的平衡等挑战重重。正是在这个关键节点上,何恺明团队在CVPR 2026一口气交出了五篇重磅论文,从不同角度对生成范式发起冲击。这五篇论文看似各自独立,实则指向同一目标:寻找扩散模型统治下的突破口,重新定义图像生成与视觉理解的底层逻辑。

CVPR 2026何恺明团队五篇论文深度解读:流匹配、单步生成、视觉推理全面突破

一、JiT:让扩散模型真正“去噪”,回归预测干净图像

扩散模型在训练时,通常预测的是噪声 ε 或速度 v,而不是干净图像 x 本身。这一做法几乎成了默认设置,但其背后的代价被长期忽视:噪声与速度并不在自然图像的流形上,它们属于高维空间中的“离群量”。网络被迫去预测一个它并不“理解”的东西,这需要消耗额外的表达能力和先验知识。与之相反,干净图像 x 就在图像流形上,是模型经过训练后能够自然逼近的目标。JiT(Just in Time)正是从这个看似简单的洞察出发:既然我们要得到的是干净的图像,何不让网络直接预测 x?

这一思想直接挑战了扩散模型的经典训练范式。为了让理想落地,JiT 采用了标准 Vision Transformer,但做了一个反直觉的架构选择:使用极大尺寸的 patch——16×16、32×32 甚至 64×64。理由是,当预测目标本身就在图像流形上时,网络不再需要耗费资源去对抗流形外的高频噪声,因此大尺寸 patch 并不会造成信息丢失,反而让模型更专注于学习图像的基本结构。与此同时,JiT 彻底抛弃了常用的 VAE Tokenizer,无需预训练的潜空间,也无需任何额外的 GAN 损失或感知损失,只用一个最朴素的 Transformer 直接在像素空间上执行去噪。

这一设计带来了一个令人惊喜的特性:模型参数量仅为 86M,但可以原生适应从 256×256 到 1024×1024 的不同分辨率,计算量几乎没有变化——只需要调整 patch 大小即可。最终,JiT 在 ImageNet 512×512 上,在没有蒸馏、没有外部模型辅助的条件下,从零训练取得了 FID 1.78 的优异成绩。这证明了一个被压抑了五年的可能性:让扩散模型回归“去噪”的本质,就足以引发质的飞跃。

论文链接:https://arxiv.org/abs/2511.13720

CVPR 2026何恺明团队五篇论文深度解读:流匹配、单步生成、视觉推理全面突破

二、VARC:18M参数的纯视觉模型,推理能力比肩人类

ARC(Abstraction and Reasoning Corpus)是衡量 AI 抽象推理能力的经典基准,每个任务由极少数示例定义,要求模型推断规则(例如对称性、重力方向、颜色连续性、反射变换等)并泛化到新样本。这些规则本质上是视觉的、空间的概念,与语言并无必然关联。然而,学界惯性的做法是将其转化为文字问题,用 GPT-4、Claude 等大语言模型刷榜,这无形中强化了一个假设:视觉抽象推理必须依赖语言作为中介。

VARC 的出现就是为了打破这一假设。它将 ARC 重新建模为纯粹的图像到图像翻译问题,仅用一个 18M 参数的 ViT 从头训练,完全不涉及任何语言能力。为了让小模型胜任推理,VARC 引入了“画布”策略:将输入网格嵌入到预定义的 32×32 大画布上,用第 11 种颜色填充背景,这样 token 数量从有限的网格拓展到更大的空间,使注意力机制能自由捕捉远程视觉关系。更重要的是,VARC 在推理阶段使用了测试时训练(TTT),即利用当前任务的少量示例对模型进行快速微调,让模型现场学习规则,而不是死记硬背。

结果是惊人的:在 ARC-1 数据集上,VARC 单模型准确率达到 54.5%,集成后更是提升至 60.4%。这一数字与人类平均水平(60.2%)以及顶级大语言模型的表现旗鼓相当。一个参数量仅为大模型几千分之一的纯视觉架构,在需要高强度抽象推理的任务上与人类打平——这有力地证明,只要给视觉模型提供一个足够大的“思考空间”和即时学习的能力,语言便不再是抽象推理的必需品。

论文链接:https://arxiv.org/abs/2511.14761

CVPR 2026何恺明团队五篇论文深度解读:流匹配、单步生成、视觉推理全面突破

三、BiFlow:归一化流的效率革命,单步生成加速700倍

归一化流(Normalizing Flow)是生成式建模中历史最悠久的框架之一,它理论优雅,能精确计算似然,同时支持生成和密度估计。但长期以来,它在大规模图像生成上被扩散模型全面压制,根源在于两个结构性约束:第一,前向变换必须精确可逆,这迫使网络采用受限架构,无法使用强大的 Transformer;第二,逆向采样必须自回归顺序计算,无法并行,生成一张图像的时间成本极高。这使得归一化流逐渐沦为“理论上优美、工程上鸡肋”的存在。

BiFlow 的解题思路初看起来相当反直觉:让逆向过程不再必须是前向过程的精确逆。前向过程依然保持数学上的严格可逆性,确保分布映射准确;但逆向过程独立训练一个全新的模型,它不需要解析地等于前向的逆,只需要近似逆映射即可。正是这个“放弃精确逆”的创举,将逆向模型从自回归顺序瓶颈中解放出来,使其可以采用完全并行的 Transformer 架构,真正实现单步生成。

但逆向模型独立训练可能带来表示空间错位的问题,为此 BiFlow 引入了隐藏层对齐机制,利用前向过程的中间状态轨迹来监督逆向模型的学习,强制两者在隐空间保持一致。这一设计使模型既享受了 Transformer 的强表达力,又继承了前向过程的分布结构。最终,BiFlow 在 ImageNet 256×256 上取得了 FID 2.39,刷新归一化流的历史纪录;更震撼的是速度数据:单张图像生成时间从 TARFlow 的 0.7 秒骤降至 0.001 秒,加速约 700 倍。归一化流长久背负的效率枷锁,被一举打破。

论文地址:https://arxiv.org/abs/2512.10953

CVPR 2026何恺明团队五篇论文深度解读:流匹配、单步生成、视觉推理全面突破

四、iMF:无蒸馏单步生成,FID 1.72打破扩散垄断

“快进生成”的目标是让扩散模型用 1 步而不是数百步完成采样,此前工业界的主流方案几乎清一色依赖蒸馏:训练一个慢速但高质量的教师模型,再通过蒸馏得到一个快速的学生模型。这条路线虽然有效,但训练流程复杂,学生的性能上限被教师锁死。何恺明团队在 2025 年 5 月提出的 MeanFlow(MF)首次将“均值速度场”引入单步生成,试图绕开蒸馏,但初代 MF 存在三个系统性的致命伤:

  • 训练目标自依赖:MF 采用“平均速度损失”(u-loss),目标函数中包含网络自身输出推导出的项,导致训练闭环震荡,方差极大。
  • 引导机制死板:无分类器引导(CFG)强度在训练时被固定,推理时用户无法调节质量-多样性权衡,失去了关键的调参自由度。
  • 架构效率低下:将时间步 t、类别标签 c、CFG 强度 ω 等多条件向量简单求和,条件之间相互干扰,参数利用不充分。

Improved MeanFlow(iMF)针对这三个痛点实施了精准“手术”:

1. 训练目标重构:利用 MeanFlow 的数学恒等式,将不稳定的 u-loss 等价转换为瞬时速度损失(v-loss)。瞬时速度 v 是网络在 t 时刻的瞬时导数,与自身输出无关,变为标准的回归问题,训练稳定性显著提升。

2. 灵活 CFG:将 CFG 强度 ω、引导区间 t_min 和 t_max 全部编码为显式的条件 token,训练时从幂分布中随机采样不同引导强度,让网络学会覆盖整个 CFG 空间;推理时用户可任意调节,甚至支持引导区间控制——只在特定噪声水平区间启用引导,其他时间段自动关闭,为调控提供了更多可能。

3. 多 token 条件注入:摒弃简单求和的粗暴做法,改为将每类条件转化为多个可学习的 token(类别 8 个、时间步 4 个、CFG 强度 4 个、引导区间 4 个),与图像 latent token 沿序列维度拼接,由 Transformer 统一处理。这一改进使 Base 模型参数从 133M 降至 89M,减少了三分之一,反而带来性能提升。

消融实验清晰地展示了每一步的增益:原始 MF 基线 FID 6.17 → 替换 v-loss 后降至 5.68 → 加入灵活 CFG 后 4.57 → 多 token 条件注入后 4.09 → 升级 Transformer 架构后 3.39 → 经过 640 epoch 长训练,最终 FID 达到 1.72。iMF-XL/2 以 1-NFE FID 1.72 的成绩,超越了所有依赖蒸馏的单步生成方法,包括 FACM-XL/2(蒸馏,FID 1.76)和 DMF-XL/2+(蒸馏,FID 2.16)。当采样步数增至 2 步时,FID 进一步降到 1.54,已非常接近主流多步扩散模型在数百步下的表现(如 SiT-XL/2+REPA 的 1.42)。“单步生成必须依赖蒸馏”的铁律,被彻底粉碎。

论文链接:https://arxiv.org/abs/2512.02012

CVPR 2026何恺明团队五篇论文深度解读:流匹配、单步生成、视觉推理全面突破

五、Pixo:像素监督的逆袭,20亿规模数据挑战潜空间霸权

自监督视觉预训练领域,近年来潜空间方法(以 DINOv3 为代表)逐渐占据主导,它们将图像通过 VAE Tokenizer 压缩到低维潜空间再进行对比学习,披靡众多下游任务。这构造了一个隐含的叙事:在大规模场景下,像素级自监督天然不如潜空间方法,因为像素空间高维、冗余、多噪声,学习效率低。Pixo(Pixel Supervision)就是要检验这一前提的真伪。

Pixo 在 MAE(掩码自编码器)的基础上进行了全方位强化:预训练任务设计得更具挑战性,迫使模型从掩码像素中重建精细信息;架构针对大规模高效训练做了专门优化;训练策略引入了自筛选机制,自动过滤低质量数据,最小化人工干预。最关键的是,它在 20 亿张网络爬取图像上进行训练,系统性地探索了像素监督的上限。

结果出乎不少人的意料:在深度估计、前馈 3D 重建、语义分割、机器人操控等多个下游任务上,Pixo 与 DINOv3 正面交锋,各有胜负,而非一边倒的落后。这表明像素监督并非过时的遗物,只要辅以足够的规模、精巧的任务设计和完善的训练策略,它完全可以与潜空间方法分庭抗礼。两种范式的竞争或许才刚刚开始,而 Pixo 至少证明了,像素空间的潜力远未触顶。

论文链接:https://arxiv.org/abs/2512.15715

总结:范式转移的路标

盘点这五篇论文,一个贯穿始终的疑问浮现出来:扩散模型对图像生成长达五年的统治,根基究竟有多牢固?JiT 告诉我们,连最基本的“预测什么目标”都有巨大的优化空间;BiFlow 证明,归一化流的结构性缺陷完全可以通过放弃“精确逆”来修复;iMF 则用无蒸馏的 FID 1.72 直接击碎了对蒸馏的依赖;VARC 让 18M 参数的纯视觉模型在抽象推理上比肩人类,动摇了语言模型的强制介入;而 Pixo 在 20 亿数据规模下让像素监督再度焕发竞争力。

这些工作并非在既有游戏规则下做增量改进,而是不断回到原点,重新审视那些被默认的技术选择。何恺明团队用一套返璞归真、大道至简的研究风格,将流匹配、归一化流和纯视觉推理等方向推到了 2026 年的聚光灯下。扩散模型未必是终点,它更像某个更高效范式出现前的过渡阶段。这五篇论文已经立好路标,接下来要看整个领域是否愿意沿着它们指出的方向,重新出发。

© 版权声明

相关文章