仅用0.05%数据换来22.9倍提速!FlashAR如何解决自回归图像生成的『慢病』?
导语:深入剖析FlashAR如何仅用0.05%数据为Emu 3.5加速22.9倍的架构逻辑。
图像自回归模型的痛点:空有高画质,却被“慢”拖垮了商业化脚步
在大语言模型统治文本生成之后,AI研究界很自然地将这套“预测下一个token”的黑魔法延伸到了视觉领域。将一张精美的图片通过视觉分词器(Tokenizer)拆解为离散的token组合,再像排队报数一样把它们逐个预测出来——这就是自回归(AR)图像生成的核心脉络。
从最初的PixelCNN,到后来的iGPT、Parti,再到近期圈内备受瞩目的Emu 3.5和LlamaGen,这种图像自回归路径所展现出来的逼真度与细节刻画能力,已经展现出与传统主流的扩散模型分庭抗礼、甚至克敌制胜的潜质。但长期关注AI生成技术的朋友都清楚,自回归模型模型身上背负着一块巨大的绊脚石:串行解码慢得让人抓狂。
标准的“光栅扫描”(raster-scan)解码方式是自左向右、自上而下,一次只吐出一个token。在生成512×512分辨率的图像时,模型需要老老实实地走完32×32共计1024步串行前向传播。只要把分辨率稍微拉高,在单卡GPU上渲染一张图动辄就需要消耗两分多钟。由于这种延迟跟分辨率呈线性增长关系,GPU强大的并发算力完全无用武之地。在对时效性有着极致要求的实时应用及高精部署场景下,这几乎宣告了它的死刑。
主流加速方案:为何总是“顾此失彼”?
为了拯救被延迟拖垮的自回归模型,各路研究团队近年来提出了层出不穷的改进构想,但遗憾的是,它们大多未能实现完美的平衡:
- 彻底颠覆生成范式:诸如VAR的“下一尺度预测”或PAR的分组并行解码。方案虽然美妙,能将步骤成倍缩减,但最大的硬伤在于必须“从头开始训练”。这就意味着原先在大规模预训练中堆砌的百亿算力化为泡影,对于中小团队而言,这笔高昂的训练成本难以承受。
- 离散扩散后处理改造:例如Emu 3.5官方曾采用的DiDA技术,试图通过后训练将自回归适配为并行解码的扩散机制。可惜这样做强行篡改了模型出厂时的原始预测目标,导致预训练与推理发生了错位。结果在实际测试中发现,随着扩散步数的压缩,生成图片的画面质量出现了极为明显的崩塌,GenEval评测分数大幅滑落。
- 投机解码插件:这种无需二次训练的“外挂”方案,实际加速效益高度依赖草稿模型的接受概率。在复杂的图像生成场景中,其最终提速空间相当局限。
于是,学术界与产业界的核心疑问被聚焦在一个关键支点上:我们能否在不重头训练、不扭曲原始预测逻辑的前提下,把现成的、已经学富五车的预训练图像自回归模型,低成本改造成一支高度并发的高速渲染队?
FlashAR登场:对角线并行与0.05%的数据奇迹
由浙江大学和阿德莱德大学联合研究团队交出的最新答卷——FlashAR,以其独特的轻量化设计,给出了令人眼前一亮的破局策略。无需庞大的数据回炉重造,在庞大的340亿参数级巨兽Emu 3.5-Image-34B上,他们仅仅使用了原始训练集中微乎其微的0.05%数据(约8万张图片),就完成了向Emu3.5-34B-Flash的蜕变,最高换来22.9倍的端到端实际加速!

- 论文标题:FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
- 项目官网:https://lxazjk.github.io/FlashAR/
- 论文地址:https://arxiv.org/abs/2605.09430
- 开源代码:https://github.com/lxazjk/Emu3.5-FlashAR
解构核心魔法:从“亦步亦趋”到“双向奔赴”
FlashAR之所以能够达成惊人的加速,底层逻辑其实源于对图像二维空间属性的本质回归。既然图像是二维分布的,我们何必要死守一维的从左到右单线思维?
既然我们可以预测右侧的下一个像素,自然也可以同时预测下方的像素。FlashAR的核心看点在于为模型植入了“水平预测头”与“垂直预测头”的双重驱动。两条路径并行协同,解码路线从单纯的串行铺满,演变为高效的对角线扩张。反映在数据上,解码步数直接由原本的 H×W(高度×宽度)骤降为 H+W-1。这意味着在512×512的分辨率级别下,原先需要漫长等待的1024步解码,瞬间被压缩到了仅仅63步。

要在尽量不打破大模型原有认知的前提下完成这一进化,底层研发团队别具匠心地设计出了三大技术支柱:
1. 从核心中段“分江引流”:中间层分支设计
在设计初期,最常规的思路或许是直接在大模型的最后一层外挂一个垂直预测头。但仔细探究特征分布后会发现,大模型的最后一层往往已经被彻底“调教”成了只适应光栅扫描的一维特化形态,很难再包容新的垂直视角。相反,浅层到中层的特征保留着更为富庶、未被加工降维的原始二维空间联结关系。
通过线性探针技术(Linear Probing)的深度剖析,团队果断选择在骨干网络的中间层开辟通道,拉出一条垂直分支。这不仅规避了末端特化特征的冲突,还让垂直头部得以与主流管线并行流转,让硬件级别的吐吞量实现跨越式升级。

2. 防止画面混沌的“交通指挥官”:可学习融合门
空间上的两个方向虽为互补关系,但各处像素对水平和垂直方向特征的敏感度是不一样的。如果采取均值相加这种惰性手段,图像在边缘衔接处很容易出现重影或虚化。FlashAR特地嵌入了一套极致精炼的MLP门控机制,做到像素级的自适应调节,灵活决定各点融合比重,进而捍卫了输出图像的高解析度。
3. 稳扎稳打的两阶段适配策略
即便数据量要求极小,在训练层面上也必须确保精度不产生漂移。团队制定了由浅入深的训练节奏:
- 首要阶段:锁死大模型的主干参数,先让垂直头单独接受微调,使其在安全区里稳打稳扎地吸收和建立起科学的上下空间认知度;
- 次要阶段:解除部分限制,将垂直头与主干网络联合优化。使预训练模型在微弱的涟漪下,轻松、自然地接纳改变,保证了收敛的从容度与数据的超级利用率。
在推理现场,开发团队同样没有松劲。他们借由FlexAttention机制编译出稀疏近邻注意力掩码,并配合硬件友好的批量KV Cache更新流程,将实验室里的理论吞吐量完完整整地转化为了显卡铜管散发出的蓬勃实效。
硬核测速:340亿超大参数模型上的无损奇迹
大模型行不行,唯有实测才是硬道理。FlashAR在34B这一几乎触到行业应用天花板的超大尺寸模型上展开了实车路测。
在业界公认难度极高的Emu3.5 34B上,运用区区8万张(占总训练集0.05%)图片的资源负荷,FlashAR直接将512×512图片的成图等待时长由原先的130.10秒缩短到了极速的5.68秒!22.9倍的端到端提速不仅肉眼可见,更加令人感到震撼的是,图像画质和语义几乎没有任何衰减。在极其严苛的GenEval图文匹配与结构检测套件下,FlashAR的总分仅仅是微跌了极其细微的0.19分(80.48降至80.29)。而在涉及颜色渲染和物体对位等高动态子环节中,它的表现甚至力压闭源的原版模型本身!相比之下,曾经被寄予厚望的BlockDiffusion评测表现直接滑坡到了73.83,对比高下立判。
在ImageNet 256×256的基准测试中,无论是小巧的Base版还是庞大的XXL版,FlashAR都将对比方案 BlockDiffusion 挑落马下。尤为引人瞩目的是,轻量化的FlashAR-L在IS测试中跑出了289.0的高分,直接击败了以高算力硬灌、从头训练产生的非自回归模型NAR-L(263.9)。在运算流转效率上,FlashAR-B交出了447.2 img/s的狂暴吞吐,把NAR-B亦拉于马下。更关键的是,团队拿到这一系列傲人成绩,后训练过程仅耗费了区区25个Epoch,是竞争对手BlockDiffusion所需训练量的三分之一。
重塑范式:让好创意免于算力破产
FlashAR之所以能引发科技圈的高度关注,除了解锁了成倍的加速成绩,更在于它向业界挑明了一条被忽视的路径:很多时候,我们不需要动辄拉起几万张卡去重构和打磨一个全新的神经网络。通过合理的后训练结构重构,大模型在预训练中所累积的关于真实世界的深刻空间表征,是可以被巧妙“转接”和重塑的。
仅用0.05%的数据、几行结构上的匠意重绘、配合巧妙的对角线调度,那些原本因极高推理成本被束之高阁的百亿级图像自回归模型,自此有了真正落地的可能性。对于那些苦于算力紧缺、又渴望在顶级图像大模型领域施展身手的开发者而言,这无疑是目前最振奋人心的曙光之一。
