机器人迈向“会预判”的关键:顶尖机构综述解析世界模型如何重塑具身智能
导语:世界模型正让机器人从反应式执行走向前瞻式决策。
世界模型正在成为机器人学习领域最受关注的核心议题之一。过去几年,机器人策略学习从传统的任务专用模型,逐渐转向更通用的 Vision-Language-Action(VLA,视觉-语言-动作)模型。借助大规模视觉语言模型和机器人轨迹数据,VLA 能够把视觉观测、语言指令与动作输出连接起来,让机器人在跨任务、跨场景泛化方面展现出更强潜力。
但真实世界的机器人控制远比“看一张图然后输出一个动作”复杂。机器人需要处理接触、遮挡、物体受力、长时序依赖、错误累积以及多步规划等问题。如果模型只根据当前观测做反应式决策,就很难判断一个动作执行后会导致怎样的后果。正是在这一背景下,世界模型重新成为机器人学习的重要方向:机器人不仅要知道“现在发生了什么”,还要能预测“如果我这样做,世界接下来会怎样变化”。

近日,来自南洋理工大学 MARS Lab、加州大学伯克利分校、斯坦福大学、哈佛大学、普林斯顿大学、ETH Zurich、牛津大学、东京大学、Microsoft 等机构的研究者联合发布综述论文《World Model for Robot Learning: A Comprehensive Survey》。这篇 43 页的综述系统梳理了机器人学习中世界模型的定义、架构范式、应用场景、评测基准与未来挑战,并配套维护了持续更新的 GitHub 资源库。

- 论文标题:World Model for Robot Learning: A Comprehensive Survey
- 论文链接:https://arxiv.org/abs/2605.00080
- 项目主页:https://ntumars.github.io/wm-robot-survey/
- GitHub:https://github.com/NTUMARS/Awesome-World-Model-for-Robotics-Policy

世界模型的重点不是“生成画面”,而是“预测后果”
在机器学习和认知科学中,world model 并不是新概念。一般而言,它指的是一种能够刻画环境状态如何随时间和动作变化而演化的预测模型。但在机器人学习语境下,论文强调需要对这一概念做更严格的界定。
机器人世界模型不应只是一个能够生成未来画面的模型,而应当能够描述“智能体—环境”之间的动态关系。换句话说,它真正需要回答的问题是:在当前状态下,如果机器人执行某个动作,未来状态会如何改变?
这也是机器人世界模型与通用视频生成模型的关键区别。通用视频生成模型可以生成视觉上看起来合理的视频,但未必具备动作一致性。例如,模型可能生成一段物体自然移动的画面,却无法准确反映夹爪动作、接触关系、受力变化和物体稳定性。对于机器人控制而言,这类“看起来合理但不受动作约束”的预测价值有限。
论文将机器人世界模型的核心能力概括为三类:
- Foresight(前瞻预测):在机器人真正执行动作之前,预测动作可能导致的后果。
- Imagination-driven planning(基于想象的规划):通过模拟多个候选动作的 rollout,比较不同方案的潜在结果。
- Data amplification(数据扩增):通过合成轨迹、生成演示数据或构造虚拟交互来改善策略学习。
这解释了为什么世界模型与 VLA 策略的结合正在加速。VLA 提供了从视觉和语言到动作的统一接口,而世界模型补充了对未来物理变化的预测结构。二者结合后,机器人策略不再只是“看到什么就做什么”的反应式映射,而有机会具备更强的前瞻性、推理能力和规划能力。
世界模型如何接入机器人策略?四类架构路线正在演进
综述首先讨论了世界模型与机器人策略结合的方式。作者按照架构范式,将现有方法划分为多类:从早期解耦式方法,到单骨干网络,再到 MoE / MoT 多专家架构、统一 VLA,以及 latent-space world modeling 等方向。

1. 解耦式路线:先预测未来,再恢复动作
早期方法通常采用“预测未来,再恢复动作”的两阶段框架。模型先利用视频生成或未来观测预测模块,生成与任务相关的未来状态;随后再通过逆动力学模型,根据当前观测和预测出的未来状态推断机器人应该执行的动作。UniPi、VidMan、Vidar、Gen2Act 等工作可以归入这一类别。
这种路线的优点是模块清晰:世界模型负责回答“接下来会发生什么”,策略模块负责把预测结果转化为动作。但它的缺点也很明显,两个模块之间存在接口误差。如果生成的视频或 latent 表征与真实动作后果不一致,后续控制就可能被误导。
2. 单一生成骨干:让预测和控制在同一模型中发生
随后,研究开始转向更紧耦合的方案。一类方法使用单一生成骨干,同时建模未来视觉状态和动作序列,把视频预测与动作生成放入同一个扩散模型或流匹配过程中。UVA、UWA、VideoVLA、Cosmos Policy 等方法体现了这一趋势。
这类方法不再把世界模型当成外部辅助模块,而是尝试让“预测未来”和“生成动作”在一个模型内部共同完成。其优势是减少模块间的割裂,让未来状态建模更直接地服务于控制;但挑战在于模型训练难度、计算成本以及不同模态目标之间的协调。
3. MoE / MoT:让不同专家协作处理多模态信息
另一类方法采用 MoE、MoT 或多分支专家结构。视频专家、动作专家和语言理解模块保持一定程度的参数独立,同时通过共享注意力、交叉注意力或层间交互完成信息融合。Motus、LingBot-VA、BagelVLA 等方法都属于这一方向。
相比完全共享骨干,这种设计保留了不同模态的专门能力:视频专家可以更好地学习时序和物理变化,动作专家负责控制输出,语言模块则负责理解任务意图。通过交互机制,视频预测中的时序信息和物理先验可以影响动作生成,从而提升策略的稳健性。

4. 统一 VLA 与 latent-space 建模:把预测目标内化到策略训练中
统一 VLA 代表了另一条路线。它们不一定显式调用外部视频世界模型,而是通过未来图像预测、视觉 foresight、结构化世界知识或 latent 动态建模,把预测目标内化到 VLA 的训练过程中。GR-1、WorldVLA、DreamVLA、UniVLA、CoWVLA 等方法都在不同层面体现了这种趋势。
值得注意的是,论文并没有简单断言哪一种架构已经胜出。当前机器人世界模型仍处在快速演化阶段,解耦模块、统一生成骨干、专家混合结构和 latent 表征各有优势。最终效果取决于数据规模、控制频率、任务复杂度、推理成本,以及模型是否真正捕捉到了动作条件下的物理变化。
世界模型不只是策略模块,也可以成为可交互模拟器
世界模型的第二类重要用途,是作为机器人学习中的模拟器。传统机器人强化学习长期面临真实交互成本高、采样效率低、复位困难和硬件安全风险等问题。如果可以用学习到的世界模型替代真实环境进行 rollout,策略就能在虚拟交互中获得训练信号。
论文将这一方向称为 World Model as Simulator。在这一范式中,世界模型接收当前观测、任务指令和候选动作,预测下一步观测、奖励或终止信号。策略模型既可以在这个学习到的环境中进行强化学习后训练,也可以在测试阶段借助世界模型评估多个候选动作。
这一路线的关键价值,是把世界模型从“辅助预测器”推进为“训练环境”。一些方法尝试使用世界模型生成 imagined transitions,用于 VLA 的强化学习后训练;也有方法通过预测 rollout 对候选动作进行排序,在实际执行前判断哪组动作更可能成功。
不过,作为模拟器的世界模型面临更高要求。用于开放式视频生成时,模型只要在视觉上保持合理即可;但用于策略训练时,模型错误会直接影响策略优化方向。一个轻微偏差的动力学预测,可能在多步 rollout 中不断放大,最终导致策略学到错误行为。因此,长期稳定性、动作敏感性和奖励一致性,是这一方向必须解决的问题。
视频生成模型能成为机器人世界模型吗?关键在动作可控与物理一致
近几年大规模视频生成模型快速发展,为机器人世界模型提供了新的基础设施。视频模型天然学习时序变化、运动连续性和空间结构,因此被认为可能为机器人控制提供有价值的先验。
但论文明确指出,机器人视频世界模型不能直接等同于通用视频生成模型。对机器人学习而言,最重要的并不是画面是否高清、运动是否“看起来顺滑”,而是动作是否可控、预测是否与真实物理后果一致。
一个真正有用的机器人视频世界模型,需要在给定语言指令、当前观测和动作序列时,生成与动作后果一致的未来状态。它还必须处理遮挡、接触变化、工具使用、场景几何和长时序任务等复杂因素。
综述将机器人视频世界模型的发展概括为几个阶段:
- Imagination-based generation:生成未来视频,用作策略学习辅助信号。
- Action-controllable world model:显式建模动作对未来视觉状态的影响。
- Structure-aware world model:引入深度、3D、对象、轨迹、场景结构等中间表示。
- Foundation-scale world model:走向更大数据规模、更强泛化能力和多任务适应性的基础世界模型。
评测标准正在改变:不只看生成质量,更看任务收益
论文的另一个重点是评测。对于机器人世界模型,仅仅评估视频清晰度、帧间一致性或生成质量已经远远不够。在机器人场景中,更关键的问题是:世界模型是否真正改善了机器人的任务表现?
未来评测应关注以下问题:
- 世界模型能否提升策略成功率?
- 能否正确排序多个候选动作?
- 能否预测失败轨迹并帮助机器人规避风险?
- 能否在长时序任务中保持因果一致?
- 能否帮助策略减少对真实交互样本的依赖?
因此,作者认为未来 benchmark 需要从 open-loop visual fidelity 转向 closed-loop task utility。也就是说,世界模型的好坏不应只由“生成得像不像”决定,而应由“是否帮助机器人做得更好”来衡量。
综述整理了多个机器人学习 benchmark 和数据集,包括 LIBERO、RoboTwin、CALVIN、SIMPLER 等,并对不同世界模型策略在这些环境中的表现进行了归类比较。结果显示,当前最有效的方法并不集中于单一架构;在不同任务下,解耦式、统一式、专家混合式和 latent-space 方法都可能表现出竞争力。
未来挑战:动作一致性、推理效率与物理 grounding
尽管世界模型在机器人学习中展现出巨大潜力,但论文也指出,距离可靠部署仍有多项关键挑战。
首先是动作条件下的因果一致性
模型不能只根据历史观测“脑补”未来,而必须准确反映动作带来的状态变化。对于闭环控制来说,这是世界模型是否真正有用的基础。如果机器人执行夹取、推拉、旋转等动作后,模型无法正确预测物体状态变化,那么它就难以支持可靠规划。
其次是推理效率
许多视频扩散模型计算成本较高,难以满足机器人实时控制需求。机器人控制通常要求低延迟、高频率决策,而完整生成未来视频可能过于昂贵。因此,越来越多方法开始探索 latent-space prediction、训练阶段使用世界模型、测试阶段跳过显式视频生成等方案。
第三是物理 grounding
真实机器人交互依赖摩擦、力、触觉、物体材质和接触稳定性,仅靠视觉预测往往不足。未来世界模型可能需要融合本体感觉、力觉、触觉以及结构化几何表示,才能更准确地理解真实物理环境。
此外,论文也强调,神经世界模型并不一定会取代传统规划和控制方法。相反,符号表示、对象关系、因果结构和经典控制仍然可能为长时序任务提供更稳定的抽象层。如何把神经预测能力与结构化规划结合起来,将是机器人世界模型的重要方向。
结语:世界模型的真正价值,是让机器人在行动前“想清楚”
这篇综述的价值在于,它没有把世界模型简单视为视频生成模型在机器人领域的迁移,而是从机器人学习本身出发,重新梳理了世界模型应该承担的功能:辅助策略生成、充当学习模拟器、支持评估与规划、生成训练数据,并最终服务于真实可执行的机器人行为。
对机器人学习而言,世界模型的核心问题不是“能不能想象未来”,而是“想象出的未来能否用于控制”。当机器人能够在行动前预测后果,在执行中校正计划,在训练中利用虚拟交互改进策略,世界模型才真正从生成模型走向具身智能系统的核心组件。