告别繁杂工具流!Meta联合港中文提出ATLAS:用单个Token重塑低功耗视觉推理
导语:介绍Meta与港中文联合推出的ATLAS框架,解读用单个Token统一Agent与隐式学习的视觉推理新路径。
在多模态AI的进化史上,视觉推理能力(Visual Reasoning)一直是一块难啃的硬骨头。面对复杂的几何绘图、物体计数或细粒度的空间关系判断,即使是最优异的大模型,也常常显露出逻辑上的局限。为了解决这个问题,学术界和工业界此前衍生出了几条截然不同的策略,但它们在实际应用中却各有各的软肋。有些模型被要求像人类画手一样,生成繁琐的中间图片作为过渡,带来了高昂的显存与计算开销;有些方案则依靠复杂的外部代码工具,调用繁重的流水线,这不仅增加了延迟,还会引入严重的中间监督依赖;而那些试图将推理过程锁在神经网络“隐空间”的探索,又往往因为黑盒属性而难以调优,泛化性极差。
最近,Meta AI 与香港中文大学的联合研究团队打破了这个僵局。他们提出了一种全新的视觉推理范式,名为 ATLAS(Auto-regressive Token-Level Action anchor for Visual Reasoning)。这个方案的核心点用一句话概括就是:仅用一个离散的 Token,在无需外部工具、无需生成中间图像且不需要显式视觉监督的前提下,将 Agent 的显式操作与隐空间推理完美结合。项目代码、数据与论文均已开源,展示出了惊人的实用潜力。
- 论文链接:https://arxiv.org/pdf/2605.15198
- 项目主页:https://atlas-oneword.github.io
- 开源代码:https://github.com/ZiyuGuo99/ATLAS
据悉,该工作的第一作者来自香港中文大学博士团队,本科毕业于北京大学,曾先后在 Google DeepMind Veo 团队、Meta AI、亚马逊 AWS 等顶尖AI实验室实习,在多模态统一生成与理解领域深耕多年,此前就曾发表过 Image-CoT、Think-while-Generate 等多篇行业瞩目的领先工作。
视觉推理的三条传统弯路
要理解 ATLAS 框架的突破性,我们需要先看看此前行业里通行的三条核心路线:
第一条路线是统一生成模型(Unified Models)。这类模型试图将所有视觉推理转化为图像生成任务。例如,遇到几何难题时,模型会先生成一张画了辅助线的新图片,再在此基础上得出最终答案。这样做虽然逻辑直观,但连续的解码和重新编码极易累积误差,且每次生成图片都要耗费海量的计算资源。
另一种广为采用的选择是代理式视觉推理(Agentic Visual Reasoning)。这种方法将模型作为控制器,调用外部工具(如 Python 脚本或者 OpenCV 接口)来进行画图、边缘检测或物体裁剪。虽然可解释性强,但这种繁琐的外部工具流带来了很高的运行延迟,且要求长文本 prompt 进行复杂的调用描述,中间数据标注也极其繁杂。
而在前两者之外,隐式视觉推理(Latent Visual Reasoning)则是另一条偏向极简的流派。它主张把推理过程放在模型的隐向量(Latent Space)里完成,避免了生成中间图像和调用工具的麻烦。然而,由于没有明确的中间输出,模型思考的过程犹如在隐匿的权重中摸索,其监督机制和优化方向极难把握,在大规模场景下泛化性也显得摇摇欲坠。

揭秘 ATLAS 的核心:一个 Token 如何充当“思考”与“动作”
既然每条路都有取舍,能不能找到一条路,既具备隐式推理的高效与简洁,又能像代理式模式一样提供可见、可控的推理操作?
ATLAS 巧妙地给出了逻辑解法:把复杂的视觉动作压缩成系统定义的一组“暗号”——也就是功能性词汇(Functional Tokens,如 <|Shape|>、<|Line|>、<|Arrow|>、<|Text|> 等)。模型在输出解答文字的过程中,可以像正常生成单词一样,自然地“吐出”这些词。别小看这短短一个 Token,它在 ATLAS 体系中同时扮演着双重核心角色:
一方面,它是Agent动作标记。模型生成这个词,就说明它在这里需要针对图像的特定部分执行某种空间、语义或边缘级别的聚焦和分析。
另一方面,它是隐式视觉推理单元。这个 Token 不需要从模型外部去调用任何代码工具,也不需要去重新生成一张临时图像,它完全处于模型的内部表示中。在自回归生成这个词的瞬间,它内部的自注意力权重会被强制拉升,促使模型将后续语义生成的关注度转移到特定视觉特征区。


训练攻坚:SFT 与 RL 双轨驯服“刷分”模型
要让网络自己学会在最合适的位置插入这组 Functional Token,绝非易事。研究团队采用了一种递进的两阶段训练流程来实现:
在监督微调阶段(SFT)中,团队精心构建了一个包含 17.8 万条指令的数据集 ATLAS-178K,该数据集涵盖了从几何线段绘制、计数、细粒度属性检查到空间拓扑关系的 40 多种视觉推理任务。团队将复杂的视觉推理和推演链条翻译成了自然掺杂 Functional Token 的文本轨迹。这类似一种“示范教育”,让网络学会什么情景该用什么动作指令(例如,遇到测量角度前自动输出 <|Line|>,在进行分区检测时输出 <|Shape|>)。
而在随后的强化学习阶段(RL),只靠微调往往容易让模型变成“复印机”。如果在强化学习中直接粗暴地奖励 Functional Token 的输出,会让模型陷入一种作弊状态:为了刷取奖励分数,模型可能会在一句简单的回答中塞进数十个毫无作用的功能 Token,这被称为“Token 滥用”。为此,研究人员专门设计了一种对偶的平衡奖励机制,不仅注重答案本身的正确率,同时为功能 Token 的使用设定了严格的效率损耗惩罚,如果为了拿分而毫无节制地滥用 Token,将遭到扣分惩罚。这迫使大模型在实际训练中,学会只有在遇到解不开的骨干逻辑节点时,才会审慎、精准地召唤这些视觉动作词。
攻克梯度稀释:Latent-Anchored GRPO 算法的作用
在 ATLAS 架构设计的实际工程落地中,研究团队遭遇了梯度稀释(Gradient Dilution)这一基础物理难题。这是因为在一个长达数百字的视觉分析与解释生成链条中,真正起到关键作用的 Functional Token 比例是非常低且稀疏的。如果直接采用业内普遍使用的 GRPO(Group Relative Policy Optimization)等以全句为评价维度的强化学习算法,那么这些个别关键 Token 的生成概率梯度极容易淹没在大量日常普通文本词汇的梯度更新海洋中,导致模型即使答对了也没法精准地将这个“功劳”记在正确的 Token 位点上。
为了攻下这座坚垒,ATLAS 提出了创新性的 LA-GRPO(Latent-Anchored GRPO) 方案。该方法的基本思路是强制在 GRPO 计算轨迹更新时,向这些代表视觉动作定位点(Functional Token)所处隐状态提供一个精准的“锚点(Token-level Anchor)”校正通道。当模型整段回答被判为优时,LA-GRPO 会有针对性地对这几个功能性 Token 的表示权重和激活概率施以专门的梯度倾斜,将全局奖励直达本质节点,保证推理路径的关键决策不被普通的文字表达噪声混淆淹没。
功能 Token 的注意力究竟落在何处
在严谨的学术论证前,自然会有质疑的声音:这些所谓的特殊功能 Token,真的在内部帮助模型进行了视觉搜索吗?还是说这只是大模型玩弄的一种词汇噱头?
针对这一质疑,研究者将训练后的网络在解题时的注意力分布(Attention Visualization)进行了切片分析。当模型遇到瓶颈生成 <|Shape|> 时,注意力的热力图高度重合地锁死了图像中物体聚集的位置;当遇到 <|Line|> 生成时,网络的注意力在空间里自主延伸到了目标图形的关键连接点或辅助线线段上;而 <|Text|> 的生成则促使网络集中视线在文字符号、计数值所在的密集点上。
这种注意力图谱的精准转变,有力地证明了 ATLAS 的 Functional Token 确实起到了承上启下的视觉导向锚点作用。模型不需要借助计算代码或 OpenCV,直接在大脑内部就能用最简练的语言符号,操控自己视觉注意力机制在各个图像维度间灵活跳跃。
更高效的未来:告别黑盒与重载的探索
与其堆砌繁重的外部系统或为了单次推理耗费巨大的计算代价生成中间渲染图,ATLAS 巧妙地用一个词作为“视觉暗号”,打通了多模态模型内部隐藏表示的推理潜力。这意味着,我们或许能在边缘计算设备或者对延迟要求极其苛刻的机器人具身智能场景中,仅凭极小维度的 Token 标记就换来强大的视觉空间规划和多步推理反馈。接下来,我们共同关注的重点将转向该框架在大规模生产环境下的普适度,以及大语言模型能否通过自主无监督进化,创造出更多连人类都未曾定义过的全新视觉动词暗号。




