推理延迟暴降72%,成本直砍76%!中大×MBZUAI开源A₁模型,打破VLA效率魔咒 | CVPR 2026 Findings

导语:打破VLA效率瓶颈:A₁模型以协同加速方案将推理延迟暴降72%,计算成本砍掉76%,在全开源条件下实现SOTA,为通用机器人操作落地铺平道路。

开放世界机器人操作一直被两大难题卡住脖子:大模型算力成本和推理延迟。千亿级视觉语言模型(VLM)骨干配合迭代扩散或流匹配动作头,让普通硬件根本无法跑起实时控制。来自中山大学、MBZUAI、Spatialtemporal AI与ATeam的联合团队直接抛出了全开源、全透明、自适应、高效率的解决方案——A₁截断式视觉-语言-动作模型。这套预算感知的自适应推理方案同时加速骨干网络与动作头,在仿真和真机上均实现了SOTA性能,彻底打破了“高性能=高成本”的魔咒。

行业痛点:VLA模型很强,但落地代价极其昂贵

Vision-Language-Action(VLA)已成为通用机器人操作的主流范式:大尺度VLM将多模态观测压缩为隐式表示,动作头(扩散/流匹配)再映射为连续电机指令,泛化性极强。然而,落地代价极高:

  • 为保证语义理解与可供性推理,模型必须使用数十亿参数的VLM骨干,推理耗时极长;
  • 为了动作平滑与精准,动作头普遍采用扩散或流匹配架构,需要十数轮迭代去噪,算力开销巨大;
  • 现有优化大多只针对VLM主干,动作头始终是被忽略的瓶颈,即便主干加速,整体延迟依然居高不下;
  • 最终结果是:能跑SOTA的VLA模型,必须依赖高端计算集群,普通硬件无法实现实时控制。

团队总结出三个关键观察,直接戳中效率优化核心:

  1. 轨迹收敛:流匹配轨迹3步内就锁定正确模式,后续迭代收益递减;
  2. 动作冗余:连续控制步动作平滑变化,只需粗更新;
  3. 层间耦合:VLM中间层已包含足够空间视觉特征,没必要跑完全层。

一句话:算力只花在“会改变动作”的地方,A₁就此诞生。

A₁架构动态示意图

核心设计:一套自适应框架,让推理全程高效

A₁没有走“轻量化重训”或“单纯剪枝”的老路,而是从推理全链路出发,提出一套预算感知、动态退出、层间热启动的协同加速方案,在不损失任务成功率的前提下,实现效率数量级提升。A₁由VLM骨干与动作头组成,VLM提供语义与可供性特征,动作头支持流匹配(FM)与MLP两种实现;自适应推理方案同时压缩骨干计算量与动作头迭代次数,兼顾速度与成功率。

图1:A₁模型整体架构

1. 多出口训练:让每一层都具备动作预测能力

传统VLA只在最后一层输出动作,A₁在训练阶段就让VLM每一层都连接共享动作头,直接监督各层输出的动作序列。这一设计让模型在推理时,可以随时在中间层读取动作结果,为动态早停打下基础。

2. 动作一致性早停:算力只花在“必要的层”

推理时,模型逐层计算动作,并与上一层结果做一致性校验。当动作变化小于阈值时,直接判定“特征足够”,提前终止主干前向。团队使用余弦相似度、L2距离等指标衡量动作稳定性,并通过训练集统计得到分层阈值,在“节省算力”与“保持精度”之间取得最优平衡。

3. 层间截断流匹配:解决早停带来的次生瓶颈

动态早停虽然加速了VLM,但会让流匹配动作头在每一层都重复执行完整去噪步骤,反而拖慢速度。为此,团队提出层间热启动流匹配:

  • 大幅减少单轮去噪步数(从10步降至2步);
  • 上一层的动作输出,直接作为下一层去噪的初始值,实现热启动;
  • 避免从随机噪声重新开始,既保证精度,又把动作头开销压到最低。

4. 多机器人泛化训练:开源数据也能练出强迁移模型

A₁采用两阶段训练:第一阶段在大规模开源机器人数据上预训练,学习通用操作先验;第二阶段在真实机器人轨迹上微调,适配不同机型与场景。团队还融合了15951条自研真机数据,进一步缩小仿真到现实的差距,让模型在Franka、AgiBot、OpenArm等多款机械臂上都能稳定工作。

A₁多平台部署示意

A₁到底解决了VLA的哪些核心痛点?

如果只看加速数字,很容易低估A₁的价值。它真正的突破,是重新定义了高效VLA的设计范式。

1. 第一次实现主干与动作头联合加速

过去的加速方案都是“单边优化”:要么压VLM,要么简动作头。A₁证明,只有协同优化,才能实现端到端延迟大幅下降。早停降低主干计算,热启动流匹配降低动作头迭代,两者耦合,才把延迟从数十秒压到秒级。

2. 用最小精度损失换取最大效率收益

实验显示,即便减少76.6%的主干计算,任务成功率仅小幅下降。这说明:VLA模型存在极端严重的过计算,大量深层特征对机器人操作来说并非必需。A₁用数据证实,动态优化不是“妥协精度”,而是“回归合理计算”。

3. 开源全栈,打破封闭壁垒

当前顶尖VLA大多依赖闭源数据与私有框架,社区难以复现。A₁全程使用开源数据训练,并开放权重、代码、数据处理流程与评估脚本,让小型实验室与普通开发者也能搭建高性能、低成本的机器人控制模型。

从仿真到真机,全面超越现有开源方案

A₁在三类标准场景上完成系统验证,结果显示:它在效率上大幅领先,在性能上同样达到SOTA。

仿真环境:高精度与强泛化兼顾

在LIBERO长期操作基准上,A₁实现96.6%的平均成功率,在物体操作任务上接近满分;在VLABench长程推理任务上,A₁超越π₀.5等模型,展现出优秀的语言理解与任务规划能力;在分布偏移更大的LIBERO-Plus上,A₁零样本性能达到75.3%,显著优于对比方法,证明其特征具备强泛化性。

表1:LIBERO、VLABench主流模型成功率对比,A₁取得领先性能

表1展示了在LIBERO与VLABench基准上,A₁与π₀、π₀.5等主流模型的成功率对比,A₁在多个子任务上均取得最优。

真实机器人:跨平台稳定执行

在Franka、AgiBot、OpenArm、Dobot-Arm四款机械臂上,A₁完成放杯子、摆水果、捡胶水、擦桌子、叠积木等一系列日常操作,平均成功率达到56.7%,明显高于π₀与π₀.5。尤其在小样本学习场景下,A₁能快速适应新任务,表现出极强的实用潜力(详见表2)。

RoboChallenge:开源模型登顶

在包含30个复杂真机任务的RoboChallenge上,A₁在完全开源、无闭源数据的条件下,取得29.00%的平均成功率,超过π₀、X-VLA、RDT-1B等一众开源模型,证明开源路线同样可以做到顶尖水平(详见表3)。

效率表现:延迟与计算量双降

在最优配置下,A₁-FM单回合推理时间从37.8秒降至10.5秒,降幅达72.3%;A₁-MLP最多可减少76.6%的主干计算,依旧保持92%以上的成功率;在真机AgiBot上,模型计算量降低84.6%,操作精度几乎没有下降,真正实现“低成本、高可用”(详见表4、5)。

行为可视化:更稳定、更鲁棒

从任务执行对比图2可以看出:对比模型容易出现物体混淆、夹爪提前闭合、抓取偏移等问题;A₁能稳定识别目标,动作连贯,在长程任务中依然保持高可靠性。同时,真机动态推理可视化(图3)显示:简单移动在浅层即可退出,复杂操作才进入深层,算力分配高度智能。

A₁打开的下一代VLA研究方向

尽管A₁在效率与性能上取得显著突破,团队仍清晰指出当前方案的改进空间,并为后续研究指明方向。

  • 无监督预训练:当前预训练依赖带标注的可供性数据,未来可引入无监督或自监督方法,从海量机器人视频与交互数据中自动挖掘可供性先验,进一步扩大数据来源。
  • 结合强化学习:A₁以模仿学习为基础,在长程任务中仍存在累积误差。后续可结合强化学习,通过环境实时反馈修正策略,提升复杂场景下的鲁棒性与成功率。
  • 异步执行与预测控制:云边推理与机械臂执行之间的同步延迟,仍会影响操作流畅度。团队计划采用异步执行、预测控制等方式,提升真机运行的顺滑度。
  • 拓展双臂协同与移动操作:A₁已成功部署在自研双臂移动平台,下一步将重点拓展双臂协同、移动操作、非结构环境适应等能力,向更通用的家庭与工业机器人迈进。

团队与开源信息

A₁第一次把“高性能、高效率、全开源”三件事同时做到位,用一套简单优雅的自适应截断方案,把VLA模型从“实验室奢侈品”拉到“可落地实用款”。研究由中山大学、MBZUAI等机构的青年科学家们共同完成,包括张凯东(中山大学硕士)、张健(MBZUAI博士生)、许镕涛(MBZUAI研究员,无界智慧CTO)等,导师梁小丹教授(中山大学与MBZUAI双聘)在具身智能领域成果颇丰。全套代码、权重、数据pipeline已开放:

论文A₁: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model

项目主页http://www.ateam.xin/#/research/A1

代码仓库https://github.com/ATeam-Research/A1

© 版权声明

相关文章