CVPR 2026 Oral | 清华阿里联手推出 ViT³:用六大设计原则重塑视觉 TTT,线性复杂度模型性能登顶

导语:清华与阿里联合发布ViT³,这是首个纯TTT视觉架构,凭借六大设计原则在分类、检测、生成等任务中取得顶尖的线性复杂度性能。

从 Transformer 的复杂度瓶颈说起

序列建模是连接大语言模型和计算机视觉的基础课题。当前统治性架构 Transformer 通过自注意力机制捕捉全局依赖,但计算复杂度随序列长度呈平方增长,这使其在长序列任务(如高分辨率图像、长视频)中捉襟见肘。研究者们长期追求一种具有线性复杂度且精度无损的替代方案,测试时训练(Test-Time Training,TTT)正是应运而生的新范式。

TTT 将注意力操作重新定义为一次在线学习:每次推理时,利用上下文 Key-Value 对快速训练一个轻量化的内部模型,再让 Query 通过该模型动态读取全局信息。这种机制天然具备线性复杂度,同时因为将“模型压缩”引入序列建模,拥有巨大的设计空间。然而,这把双刃剑的另一面是:丰富的设计选择也意味着缺少明确的指导原则,在视觉任务上如何构建理想的 TTT 模型始终是悬而未决的难题。

近日,清华大学和阿里联合团队在 CVPR 2026 上以 Oral 论文形式公布了系统性的研究成果。他们通过大量实验,首次总结出高精度视觉 TTT 模型的六条设计定律,并基于此构建了纯 TTT 架构 ViT³(Vision Test-Time Training),在多项视觉基准上超越现有线性复杂度模型,同时保持并行计算和高推理吞吐。

重新理解注意力:从加权求和到模型构建

传统的 Softmax 注意力可以视作一个用 Key 和 Value 仓促搭建的“两层 MLP”:Key 的转置构成第一层线性变换,Softmax 充当激活函数,Value 作为第二层线性权重。Query 输入该模型便得到输出。类似地,线性注意力直接通过 Key 和 Value 的外积合成一个 d×d 的线性层,再用 Query 与之相乘。两者的本质区别在于是否进行压缩:Softmax 注意力不压缩,精度高但代价大;线性注意力极度压缩,但受限于线性表示而损失严重。

TTT 则借鉴了深度学习最成功的理念——用梯度下降将海量信息压缩到参数中。它把 Key-Value 对当作一个微型数据集,通过自监督重建损失对内部模型权重进行几步梯度更新,让内部模型“学会”上下文信息,再用更新后的模型处理 Query。当内部模型选用两层 MLP 等线性架构时,整体计算复杂度与序列长度线性相关,而非线性的状态空间又保证了强表达能力。

探索视觉 TTT 的设计空间

研究团队以 DeiT-S 为基座,将 Softmax 注意力替换为 TTT 模块,在 ImageNet-1K 上系统探索内部训练设置和内部模型架构,提炼出六条关键设计原则。

原则一:损失函数的二阶混合偏导数不能为零

TTT 的内部训练发生在整个网络端到端优化的上下文中,需要对“梯度的梯度”求导以更新投影矩阵。如果损失函数的二阶混合偏导数近似为 0,梯度信号就会截断,导致某些参数无法学习。实验表明:MAE(L1 损失)因为符号函数使得二阶偏导几乎处处为 0,效果最差;Smooth L1 在平坦区域亦存在零梯度;而 L2 损失及其变体(如点积损失)能稳定传递梯度。因此,选择具有充分二阶信息的损失是 TTT 有效性的前提。

原则二:视觉任务中单次全批量内部训练更优

将全部 Key-Value 对作为一整个批量进行梯度下降(B=N),相比于划分小批次(B=N/2, N/3, N/4)能取得更好的精度。连续小批次强制引入了顺序因果关系,这符合语言建模的特性,但视觉数据通常不具有严格的因果结构,划分批次反而损害性能。多个 epoch 的内部训练虽能小幅提升准确度,但推理速度骤降,综合考虑效率,单次全批量训练成为实用选择。

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

原则三:相对较大的内部学习率(如 1.0)适合 TTT

内部模型需要快速适应当前上下文,过小的学习率(如 0.1)收敛不足,过大会导致训练不稳定。实验确定 1.0 左右的学习率在视觉场景中平衡了速度和稳定性。值得注意的是,尽管理论上学习率可能被 Key/Value 的缩放所吸收,但独立设置仍至关重要,正如同 Softmax 注意力中的温度系数难以被完全替代。

原则四:扩大内部模型容量持续提升建模能力

将两层 MLP 的隐藏维度从输入维度的 1 倍逐步扩大到 4 倍,模型性能几乎单调上升。这表明,在固定外部网络规模的条件下,简单地增大内部模型容量就能获得更强的序列建模效果。然而,代价是推理开销:一个内部模型需要经历 Key 的前向、损失的反向和 Query 的前向,约等同 4 倍于同尺寸外部模块的计算量。因此,设计轻量高效内部模型仍是重要方向。

原则五:较深内部模型存在优化难题

尝试将内部模型做成三层 MLP 或更深时,性能不升反降,且训练损失增高,说明并非过拟合而是严重的欠拟合。研究认为,这源于 TTT 的元学习属性:内部模型的初始权重本身是可学习参数,加深网络使初始点更难优化;此外,内部训练过程中的梯度消失/爆炸也妨碍了深层结构的收敛。。有趣的是,强制把深层 MLP 的输出层置为单位矩阵就能大幅提升效果,间接印证了优化瓶颈的存在。该团队指出,真正解锁深层内部模型的潜力是未来的突破口,因为理论表明网络容量随深度指数增长。

原则六:内部模型天然适合卷积架构

视觉中的局部归纳偏置极为重要。TTT 的内部模型完全可以实现为小型卷积网络,而非仅限全连接层。测试表明,采用 3×3 卷积或深度可分离卷积作为内部模型都能带来显著的性能增益。原因在于:内部训练阶段,Key-Value 的全局上下文被压缩进卷积核权重;Query 通过时,卷积算子既捕捉局部邻域特征,又从权重中获取全局信息,两种信号无缝融合,完美适配视觉任务。

ViT³:视觉测试时训练的基线模型

综合上述洞察,团队设计了纯 TTT 架构 ViT³。其内部训练采用全批量单步梯度下降、学习率 1.0、点积损失;内部模型采用轻量化 SwiGLU 结合深度卷积。该架构可即插即用,替代各种视觉 Transformer 中的注意力模块。

在 ImageNet-1K 分类上,ViT³ 优于线性注意力、视觉 Mamba 等同类线性模型,并在高分辨率物体检测(如 COCO)、语义分割和图像生成任务中展示出一致优势。吞吐量-显存曲线显示,随着输入分辨率增长,ViT³ 的推理吞吐线性变化,显存占用远低于平方增长的 Softmax 注意力,为其在超分辨率、视频等长序列任务中的部署铺平了道路。

这项工作不仅提供了一个强大的基线 ViT³,更通过系统的设计原则揭开了 TTT 的“黑盒”,指明了未来优化的方向:更深的内部模型、更精细的训练策略以及与卷积等归纳偏置的深度融合。当高效与高精度不再矛盾,视觉序列建模的下一站或许就是 TTT 的时代。

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

ViT³:清华阿里发布视觉测试时训练新架构,六大设计原则重塑线性复杂度模型

© 版权声明

相关文章