别再盲目死磕VLA了!复旦、NUS首发首篇WAM综述:英伟达力挺的“世界动作模型”到底有何乾坤?
导语:拆解首篇世界动作模型(WAM)综述,看具身智能如何告别“偏科”的VLA,迈向物理世界的真实法则。
如果你最近两年一直在关注具身智能(Embodied AI)的发展,那你对 VLA(视觉-语言-动作)模型这个词一定不会感到陌生。从谷歌的 RT-2 到各种开源的 OpenVLA,把机器人的视觉交互、语言理解和动作控制塞进一个大模型,似乎成了行业的标准解法。然而,这种风潮正在遭遇一股强烈的底层反思。
在红杉 AI Ascent 大会上,英伟达具身智能团队的掌门人 Jim Fan 用短短 20 分钟的分享给这股热潮泼了一盆冷水。他一针见血地指出:当下的 VLA 模型,本质上更像是“LVA”——它把绝大部分的参数和计算资源倾注在了语言逻辑上,导致模型往往缺乏真正的物理常识,一旦面对复杂的现实动态交互,动作执行就频繁“翻车”。
Jim Fan 给出的破局方案非常硬核:复刻大语言模型的“伟大的平行”(The Great Parallel)——与其费尽心思让机器人去猜测下一个文本 Token,不如让它直接去预测物理世界的下一个状态。这种“先预测世界运转,再生成对应动作”的新范式,正是当下具身智能前沿最火爆的概念——世界动作模型(World Action Models,简称 WAM)。
虽然 WAM 正在被各大顶级硅谷实验室视作下一代具身底座,但行业此前一直缺少一份系统性的梳理和统一的技术定义。近期,复旦大学可信具身智能研究院、上海创智学院,以及新加坡国立大学(NUS)联合发表了全球首篇 WAM 详尽综述,试图为这个狂奔中的新兴赛道画出一张清晰的“导航地图”。

- 论文题目:World Action Models: The Next Frontier in Embodied AI
- 作者单位:复旦大学、上海创智学院、新加坡国立大学
- 论文地址:https://arxiv.org/pdf/2605.12090
- 开源项目:https://github.com/OpenMOSS/Awesome-WAM
为了让大家能迅速看清这个可能终结 VLA 的技术范式到底长什么样,我们来看看这份综述为我们拆解的核心逻辑。

从 VLA 转轨 WAM:底层逻辑的跃迁
要理解 WAM 的优越性,必须先揪出 VLA 的硬伤。在传统 VLA 体系里,机器人的思考过程是单向且缺乏闭环的。模型只负责根据眼前的画面和指令输出动作,它根本不在乎、也不主动去预测“这个动作做完后,周围环境会有什么物理改变”。缺乏这种对未来的预判,机器人在倒水、抓取软体目标时,自然就表现得笨手笨脚。

这篇论文用一组极为优雅的概率公式,点出了区别所在:
- 传统 VLA 模型: p(a | o, l)。即基于当前观测 o 和语言指令 l,直接映射并输出动作 a。
- 独立的世界模型(WM): p(o’ | o, a)。它更像是一个“预言机”,输入当前观测 o 与假定动作 a,去预测未来的物理状态 o’。但它通常只作为算法的外挂或模拟器。
- 世界动作模型(WAM): p(o’, a | o, l)。这是一种彻头彻尾的联合建模。在同一个大脑里,同时生成未来的物理状态预测 o’ 和对应的控制动作 a。
换个通俗的说法,以前的世界模型只当参谋(画出未来图景),而 VLA 只当执行手;但在 WAM 时代,这套机制被内化进了同一个神经网络。“世界会发生怎样的物理演变”与“我应当如何发力控制”成为了一个不可分割的联合命题。从当前的架构探索设计来看,WAM 阵营主要分成了“级联式”(Cascaded)与“联合式”(Joint)两条路线。
级联式 WAM:“先脑补,后行动”的渐进美学
级联式 WAM 巧妙地将世界预测与控制步骤拆分开来,遵循着人类先想象、后动手的物理逻辑。这套架构内部又分化出了两条截然不同的生成路径:

显式生成(Explicit Generation)
它先让一个庞大的视频生成模型根据当前场景,模拟出一段高度逼真的任务达成短视频(即像素级路径规划)。随后,一个逆动力学模型(IDM)或几何计算网络,会盯着这段视频把动作细节反向提取出来,交付机器人执行。这种做法直接移植了互联网视频大模型的强大视觉常识,可解释性极强;但它的代价是极高昂的视频生成算力和相对滞后的物理感知精度——毕竟,“看起来没毛病”不等于在运动控制上完全可行。
隐式生成(Implicit Generation)
为了兼顾实时性能,隐式生成路线直接抛弃了解码出人眼可见视频的包袱,转而在高维的隐空间(Latent Space)直接对未来场景的物理表征进行推理。机器人在脑海里完成的只是一串抽象的数据流,随后被迅速喂给控制网络。不仅极大地缩减了推理延迟,更顺应了机器人的天性:比起画出一幅精美的未来画卷,以最快速度提取出指导控制的关键物理特征,才切中真机部署的要领。
联合式 WAM:大一统大脑的暴力美学
相比于各司其职的级联式,联合式 WAM 则是将未来演变与动作生成锁死在同一个模型框架,追求极致的端到端。这也是各大顶级学术机构目前更加看好的方案,其主要分支包括两大生成技术流派:
流派一:自回归路线(Autoregressive)
自回归机制完美继承了大微调时代 Transformer 对 Token 的吞吐偏好。它将环境图像、未来演变目标以及控制动作,全部切片、泛化并打包为统一格式的离散 Token 流,在时间线的推移下顺次预测:
- 显式解耦表征:利用不同的网络预测头分别吐出画面与控制参数,让视觉先验为动作生成铺路。
- 统一离散表征:多模态数据在同一套 Tokenizer 下大一统,使用与语言模型无二的自注意力机制做跨模态融合生成。
- 隐空间预测:避开沉重的像素渲染,在离散的 Latent Token 层级完成未来状态的自回归推理。
流派二:扩散/流匹配路线(Diffusion-based & Flow Matching)
如果说自回归擅长离散逻辑的推理,那么扩散模型则是连续、平滑、多峰动作控制的行家里手。但如何解决扩散模型极高的推理开销与机器人高频实时控制的尖锐冲突?业界探索出了两类巧妙的设计:
- 单流融合架构(Unified Stream):将视频状态与动作坐标合并到唯一的去噪骨干网络中同步演算,耦合深度极高。既可以走显式生成的路线以辅助直观理解,也能采用隐式未来对齐(Implicit Future Alignment),仅在训练期拿未来帧当作物理导师做监督约束,在实际部署阶段直接省去未来状态的显式去噪,堪称边缘硬件部署的瘦身妙计。
- 多流耦合架构(Multi-Stream Coupling):图像和控制模块各走各的分支,中途开辟特殊通道进行高频的交互与融合。例如采用交叉注意力机制持续对齐特征、或者直接利用隐状态单向控制输出,也有先经过一个深度语义共享后再依靠各自的解码头吐出动作。
数据战役:打破硬件边界的大熔炉
在 VLA 的叙事里,数据采集是所有机器人口中的痛。昂贵且动作维度对齐严苛的真机轨迹,锁死了具身智能向大模型规模化迈进的通路。而 WAM 带来的绝妙变局在于:它让机器人能够直接消化海量完全不带动作标签的网络原始视频。
这篇综述深入刻画了目前 WAM 赖以成长的四类核心数据来源,展现出其无与伦比的数据宽容性与扩展效率:
- 真机遥操作轨迹:尽管数据最为昂贵、收集规模天然受限,但其超高的物理保真度和与执行器强对齐动作优势,依然是系统调优不可替代的底层压舱石。
- 便携式人类示范(如 UMI 设备):兼得环境的多样性与低采集开销,极度契合大规模复杂动作策略的捕捉。
- 仿真环境生成(Sim-to-Real):为模型提供完美的几何碰撞深度和精确的物理特征反馈,是攻坚高难交互低成本的极佳选择,但需要不断抵御物理引擎失真的跨域鸿沟。
- 人类日常及第一人称网络视频:拥有近乎无穷无尽的多样性,涵盖了最为复杂的场景变换。即便缺乏直接的动作关节指令,WAM 通过自监督预测物理未来,从大量“吃播”、“手工视频”里源源不断地领悟世界的重力、阻力与几何变化常识。
冷静思考:从实验室技术走向物理世界的底层硬伤
世界动作模型固然展现了极其诱人的概念图景——动作前先预知未来。但要将这套理论成功装进工厂、物流或者家庭机器人的身躯中,我们不得不直面这篇综述所列举的几个致命硬伤:
首先是来自物理预测开销与超高频实时控制的尖锐矛盾。工业级机械臂或双足机器人的运行通常需要 100Hz 以上的极高控制频率,以应对任何微小的扰动。如果 WAM 运行一次复杂的生成式视频未来演练需要花费几百毫秒甚至数秒时间,那即便预测的未来再完美,也早已错失了瞬息万变的控制窗口。如何在毫秒级延迟内提炼出“维持有效控制的物理状态精简集”,仍是极大的工程瓶颈。
其次是“纯物理视觉表征”的天然局限性。人机共生或高精度装配任务的本质其实是高密度的接触物理学。软硬阻力、摩擦系数、微小变形以及遮挡常态,往往很难单凭几帧漂亮的 RGB 视频流预测完全覆盖。多模态在力觉、触觉以及机器人关节本体感受(Proprioception)层面的融合,在当前的 WAM 方法论中依然处于极其生涩的探索起步期。
同样不可忽视的还有长时程任务规划中的状态漂移与误差累积。当机器人试图脑补很长一段时间后的未来画面时,每一帧生成的轻微偏差将呈指数级放大,最后往往失之毫厘谬以千里,造成灾难性的“物理幻觉”。这就给未来的架构变迁提出了迫切的重构命题:我们是否需要像人类脑皮层分工那样,由高层网络仅负责粗糙宏观物理走向的指引,而在低层交由快反应、高频度的微观控制系统去收敛动作误差?
世界动作模型 WAM 的真正意义,并不是给原本脆弱的机械动作找一个花哨的未来预测插件。它的首要洞察,是为具身智能重塑了关于生存的“第一性原理”:在鲁莽地执行下一个指令之前,请先学会在脑海中洞悉这个动作将赋予整片物理世界怎样的波动。在这场迈向“伟大物理平行”的激流探索中,属于世界动作模型的演进帷幕,才刚刚徐徐拉开。

