生成效率狂飙5倍!谢赛宁团队发布RAEv2:彻底颠覆传统VAE的视觉表征革命
导语:谢赛宁团队携手Adobe发布RAEv2,解决第一代重建硬伤,收敛速度狂飙5倍,展现统一表征新潜力。
在AI图像生成领域,“能力越强、算力代价越高”似乎是一条颠扑不破的定律。当各大厂商拼命堆叠GPU、训练更大参数的模型时,学界却开始反思一个更本质的系统性内耗:我们现有的主流图像生成模型,是不是一直在做无谓的“乱子重造”?
传统的变分自编码器(VAE)在压缩图像时,对眼前的场景语义一无所知;与此同时,像DINOv2、SigLIP这类成熟的预训练视觉编码器,早已在数亿张图片上锤炼出了极其深厚的视觉常识。既然如此,生成模型为什么不能直接在这些“懂语义”的空间里进行创作?
2025年10月,纽约大学谢赛宁团队提出的“表征自编码器(Representation Autoencoder,简称RAE)”框架,尝试终结传统VAE的时代。然而,初代RAE在落地时遇到了难以回避的痛点:重建精度跟不上专用VAE、无法原生适配引导机制、训练收敛过慢。为了解决这三大掣肘,五个多月后,该团队联合Adobe Research与澳大利亚国立大学带来了全面重构的升级版——RAEv2。这不仅是对前代缺陷的补丁,更是一次关于视觉表征融合的深度探索。
从物理像素到语义空间的范式转移
想要彻底看清RAEv2的价值,我们得先盘明白传统VAE为什么会成为当前的性能瓶颈。
我们可以把图像生成的整个链路类比为大型图书检索系统。传统VAE的编码器扮演的是图书登记员的角色。在将每本书存入索引卡片柜(即潜在空间)时,它只记录书本的物理样貌,比如封面的主色调、纸张厚度、排版字号。当生成模型(扩散模型)在这个卡片柜里根据读者需求编撰新书时,因为卡片上没有任何关于内容的逻辑分类,它每次必须耗费极大的资源去重新领悟“什么是猫”、“什么是树”。
而DINOv2等预训练视觉编码器,更像是一个学识渊博的图书管理员。它产出的卡片记录的是高度凝练的内容语义、角色结构和场景空间布局。如果生成模型能直接在这个充满常识的潜在空间里展开工作,就无需从零开始感知世界的构成规律。
这正是RAE的核心逻辑:用现成的强语义编码器作为抓手,仅仅训练一个配套的解码器来还原图像。不过,初代RAE的瓶颈也恰恰出在这里——它仅仅抓取了图书最后一章的最终结论,导致中间大量丰富的章节细节在编码过程中流失了。
破局的关键:RAEv2的三大底层洞察
为了打破这一局限,研究团队基于大量底层实验,推导出了三个行之有效的设计设计方案。
洞察一:多层特征融合释放隐藏的细节信息
过去,初代RAE直接使用编码器最顶层的特征来进行潜在表征。然而,一个模型的完整认知通常分布在它的层级推理路径中。越到顶层,语义越抽象,空间细节的丢失也就越严重。
RAEv2给出的解法极其轻量且优雅:无需引入任何新的参数,也无需额外训练数据,直接将编码器最后K层的特征进行相加,作为最终输入潜在空间的表征。
实验数据直接印证了这一直觉的正确性:当融合层数从单层(K=1,即原始RAE)递增至全层(K=23)时,图像重建质量经历了跨越式的提升。重建误差(rFID)从0.60大幅下降至0.18,峰值信噪比(PSNR)则直接从18.93 dB拉升到了27.03 dB。这意味着,解码器拿到的不再是干瘪的最终标签,而是结构扎实的立体拼图。

洞察二:RAE与REPA在维度上的神奇互补
在此前的学术讨论中,不少研究者倾向于认为RAE与REPA(表征对齐损失算法)存在职能上的重合。因为既然潜在空间本身就由视觉编码器定义,再去扩散模型中游蒸馏对齐,听起来很像多次一举。
但研究团队通过对27种不同的视觉编码器进行详尽的控制变量测试,推翻了这一经验主义直觉。数据显示,无论是哪种规格的视觉编码器,只要将RAE与REPA搭配使用,最终的图像生成表现都会显著优于任何一方的单打独斗。

之所以能形成1+1大于2的效果,归功于两者的维度互补。RAE提供的是关乎“有什么”的高维全局语义(表现为线性探针准确率LP的强关联);REPA则提供了指引“在哪里”的空间几何结构(表现为局部自相似性LDS的强关联)。通过相关性量化分析,两者的互补表现出了极其强烈的统计学规律。
这也解开了初代RAE开发时的一个未解之谜:为什么更强的DINOv3-L在老架构里的效果甚至不如DINOv2-B?答案是,DINOv3-L的超强空间表征能力在缺乏REPA机制时根本无法被充分释放。在RAEv2的全新架构下,这个潜能终于得以完全展开。
洞察三:用数学之美换取零成本的引导机制
图像生成模型在实际推理时,为了获得更好的画质,通常离不开无分类器引导(CFG)这一机制。但在初代RAE中,我们无法直接套用传统的CFG,不得不另外训练一个辅助的弱版扩散模型(AutoGuidance)来进行差异计算,这增加了训练的算力负荷与推理开销。
团队在深挖架构时注意到一个隐藏的结构特性:在RAE框架中运行的REPA,在本质上执行的就是“预测干净图像特征”的过程(即x预测)。同时,REPA仅能触及主模型的浅层特征,这意味着它天然就是一个理想的“弱化参考版”。
RAEv2直接重新设计了主模型的预测输出格式,借此将REPA隐式对齐网络作为现成的无条件引导基线。这一改进省去了额外模型的开发与推理阶段的多余前向计算,将原本高昂的引导开销做到了近乎零成本。
收敛狂飙与算力减负的实证表现
这三大技术更新糅合在一起,最终换来了RAEv2在多项硬核指标上的亮眼表现。
以ImageNet-256图像生成任务为例,RAEv2在仅经历了80个epoch的低负荷训练后,生成的gFID指标即达到了1.06。如果换用更苛刻的FDr6评测指标,RAEv2在这个训练阶段交出了2.17的优异成绩,而初代RAE在延长十倍训练时间并引入繁复后处理手段后,也仅能拿到3.26的分数。
为了更直观地衡量模型的开发迭代成本,团队引入了“EPFID@k”指标,用以统计当生成质量达到可用门槛时所需经历的训练时长。在实际测试中,初代RAE达成EPFID@2的目标需要177个训练周期,而RAEv2以同样的算力消耗,仅用35个周期便彻底完成了任务。其收敛速度相比初代提升了5倍以上。
在算力层级的较量中,RAEv2在生成期间耗费的算力仅有189 GFLOPs。作为参考,目前在各大平台高频使用的FLUX.1等底层商业模型,在处理类似画面表现时,资源耗费达到了448 GFLOPs。RAEv2成功用不到商业框架一半的计算负载,展现出了极其贴近且在局部实现超越的反超实力。
不止是图像,在更多领域的多点开花
谢赛宁团队在验证完ImageNet基准后,没有止步于此,而是把RAEv2带入到了更复杂多变的任务环境里。
在文本生成图像(Text-to-Image)应用中,团队选用SigLIP-2进行编码适配,RAEv2同样表现出了惊人的学习速度,并在主流测试集上迅速拉开了与对比组方法的优势。在更考验机器时间尺度推理的具身场景——例如自动驾驶或机器人的“世界模型”前向未来预测中,RAEv2同样为画面的连续性和保真度带来了质量跨越。这足以论证,该框架具备极强的普适拓展性,而不是特定温室环境下的调参产物。
走向“看”与“画”底层的无缝融合
科技行业的发展总是有趣的,RAEv2的研究历程,也是一条对人工智能多模态底层架构的解构探索过程。
在过去很长一段时间里,AI的视觉感知模型(如用于图像分类、分割的DINOv2或CLIP)和视觉生成模型(如SD、FLUX)就像是同一座高山两侧的攀登者。虽然同属视觉范畴,但它们并没有真正共享过统一的知识表示,生成网络往往为了输出一张合格的图片,不得不重复去建立一遍本该通用的语义认识。
RAE框架则在此处搭起了一座坚实的桥梁。当图像生成架构能够游刃有余地在辨识模型提炼的表征语义集中展开编辑与推衍,从根本上实现了对“看”与“画”在概念层级的物理对齐。基于此开发的未来多模态AI,或许可以直接在一个统一的特征空间内,一面进行严丝合缝的符号化逻辑分析,一面将想法快速还原为高精度的图画输出。
相对于gFID数值上的细小波动,RAEv2背后的这套大一统多模态架构设计理念,无疑才是更值得业内关注和探讨的方向。




