100亿美元赌局:世界模型如何从“在梦里学开车”进化成机器人终极大脑?
导语:世界模型承诺让AI理解物理世界并预测未来,但什么是真正的世界模型?本文回溯其四十年的演进,拆解当前技术现状与资本热潮。
一个从未见过鞋带的机器人
一个机器人走近一团鞋带,它从未见过鞋带,也从未被人类遥控示范过如何解开。但它俯下身,稳稳地抓住鞋带,抽出,解开——一气呵成。这一切,源于它曾在一个模型中“观看”了几千小时人类双手操作物体的视频。那个模型学会了物体被拉、扭、推时的运动规律,让机器人在动手之前就能在想象中预演接下来的物理反应。它反复在自己的“梦境”里练习,然后才触碰现实。
这就是世界模型(World Model)的承诺:一个对物理世界理解足够深入,以至于能预测下一步会发生什么并采取行动的模型。它不是用文字描述世界的语言模型,也不是只会生成画面的视频生成器,而是一个真正理解事物运作方式的模型。

1. “世界模型”:一个术语,两条命脉
过去18个月,超过100亿美元涌入“世界模型”这个概念。Yann LeCun 离开 Meta 去构建世界模型;Danijar Hafner(Dreamer 系列作者)从 DeepMind 出走创业;NVIDIA 开源了一整套系统;OpenAI 关闭 Sora 团队,声称将转型“机器人世界仿真”——三周后,该团队负责人离职。
然而,多数被冠以“世界模型”之名的系统根本不是真正的世界模型。这个术语如今涵盖了视频生成器、强化学习的梦境机器、抽象表示学习器、动作预测基础模型等截然不同的东西。这些分歧,源自两条长达数十年彼此独立的演进路径,直到 2024-2025 年间才真正交汇,共同孕育出我们今天所说的“视频世界模型”。
2. 线索A:学会做梦——强化学习的梦想机器(1990—2025)
“智能体应该构建内部环境模型”这个理念早于深度学习。1943年,Kenneth Craik 在《解释的本质》中提出,人类在脑海中携带现实的“小型模型”来预演未来。1990年,Jürgen Schmidhuber 发表《让世界可微》,将这一概念形式化:智能体应学习一个可微的环境模型,并用它规划行动。这个想法沉睡了近三十年。
2018 年,David Ha 和 Schmidhuber 以一篇《World Models》论文和交互网站 worldmodels.github.io 将理念唤醒。其架构由三部分组成:一个VAE将像素压缩为潜在向量,一个MDN-RNN在潜在空间中以概率方式预测动态,以及一个完全在想象中展开训练出的微型控制器。智能体在自己的梦境中训练,然后部署到现实——在赛车和VizDoom游戏中得到了验证。


Danijar Hafner 随后用六年时间深耕相同理念。他的 RSSM 架构(PlaNet, 2019)结合决定性记忆与随机不确定性;Dreamer 系列从简单连续控制(V1)进化到人类水平Atari(V2),再到用单一超参数集覆盖150余个基准的V3——甚至在《我的世界》中从零开始收集钻石。Dreamer 4(2025年底)用 Transformer 替换循环骨干,速度提升25倍。DayDreamer 更让四足机器人仅用1小时现实世界互动从零学会行走。
DeepMind 的 MuZero(2020)走了另一条路:它学到的世界模型只预测奖励和价值,从不重建观测,仅对决策相关内容建模。尽管从未生成单帧像素,它征服了围棋、国际象棋和Atari。这与Dreamer用观测重建作为训练信号的哲学截然不同,但核心理念一致:想象可能的未来,选择最优行动。
这条线索的遗产:核心理念——学习动态,在想象中训练策略,动作条件化,样本高效。但它无法跨环境泛化:每个新游戏都得从头来,模型很小(百万参数),梦境是人类无法解读的抽象向量。
3. 线索B:从观看中学习——视频生成模型的崛起(2016—2025)
另一条线索默默从海量视频中汲取物理知识,分三阶段演进。
第一阶段:视频预测用于规划(2016–2018)。Atari上的动作条件视频预测(Oh等人, 2015)和真实机器人推物(Finn等人, 2016)展示了原理,但预测几帧后就模糊退化了。
第二阶段:从人类视频中学习表示(2020–2022)。关键转折:不再直接预测视频,而是用人类视频学习可迁移的视觉表示。R3M(Nair等, 2022)在数千小时第一人称Ego4D视频上预训练,捕捉物体身份、空间关系等特征,使机器人仅凭20次演示便学会操作任务。OpenAI的VPT(2022)在7万小时《我的世界》YouTube视频上预训练,仅需少量演示即可微调成能干的智能体。EgoMimic(Kareer等, ICRA 2025)甚至将人类视频直接当作演示数据联合训练,性能最高提升228%。
但人类视频终究只是策略的训练数据,不是可反复练习的仿真器。
第三阶段:大规模视频生成(2022–2024)。扩散模型应用到视频,Meta的Make-A-Video、谷歌的Imagen Video到Sora的爆发。Sora(2024年2月)在海量视频上训练后,生成了看似遵循物理规律的画面。OpenAI将其定位为“世界仿真器”,但它不具备交互性:使用双向注意力,所有帧同时看到彼此,无法注入动作。它是一部电影,不是游戏。
这条线索的贡献:证明人类视频包含可迁移的物理知识,实现大规模逼真生成,提供互联网规模的数据多样性。但它缺失了实时响应动作的能力。
4. 融合:当梦境机器遇上视频生成(2024—2025)
两个社区各自拥有对方缺失的东西:强化学习有动作条件化但无泛化;视频领域有规模与真实感但无交互。一系列工作弥合了鸿沟:
- Genie(DeepMind):引入潜在动作模型,从无标签视频中发现动作空间。Genie 1(2024-02)仅有160×90分辨率、1fps的概念验证;Genie 2(2024-12)提升至720p,连贯10-60秒;Genie 3(2025-08)达到24fps、720p,连贯数分钟,但运行成本约每小时100美元。
- UniSim(ICLR 2024杰出论文):首次在视频扩散模型内部完整训练强化学习策略,零样本迁移到真实机器人,成功率81%。
- AR-DiT / CausVid(CVPR 2025):将视频扩散模型改造为自回归和因果形式,使得逐帧生成并注入动作成为可能。
- Self Forcing(NeurIPS 2025):将35步去噪压缩到4步,首次实现通用视频模型的实时交互生成。
- DreamGen(NVIDIA, 2025-05):在少量真实机器人视频上微调视频生成模型,用语言指令生成从未做过任务的合成视频,再通过逆动力学模型提取电机指令。仿人机器人仅凭一次抓放演示,在未见环境中完成22种新行为。
- DreamDojo / DreamZero(NVIDIA, 2026-02):在44,711小时人类第一视角视频上预训练,通过潜在动作空间实现动作条件化,经Self Forcing蒸馏后实时运行。DreamDojo能以与真实世界结果皮尔逊相关系数r=0.995评估机器人策略;DreamZero则能单次前向传播联合预测视频和电机动作。
融合后的世界模型,在架构上师承视频生成,在精神上传承强化学习世界模型。
5. 准绳:世界模型必须满足的五大属性
并非所有视频模型都是世界模型。共同创作多个自回归扩散架构的Xun Huang提出了五个尺度:
- 因果性:时间只向前流动,双向生成违反这一点——硬约束。
- 交互性:实时响应动作,否则只是电影——硬约束。
- 持久性:长时间保持连贯。目前最佳可达数分钟,数小时尚无。
- 实时性:满足应用需求的速度,当前最先进为10-30fps。
- 物理准确性:遵守真实物理规律,最难也最具争议。
因果性和交互性是二元的:没有就不能叫世界模型。其余三条是连续谱。当前各类系统在这些属性上参差不齐,Genie 3在持久性上领先,但物理准确性仍普遍薄弱。
6. 世界模型现在究竟能做什么?
从最成熟到最具推测性的用例,差距巨大:
自动驾驶仿真是最成熟的应用。Wayve的GAIA世界模型、Waymo等已用学习型世界模型生成驾驶场景进行测试,无需完整物理精度,但要有足够的视觉真实感来发现边缘案例。该应用已在生产环境中落地。
娱乐与游戏紧随其后,演示最为直观。Decart的Oasis是一款完全由世界模型实时生成的类Minecraft可玩游戏;Genie 3以24fps、720p生成可探索环境;GameNGen以20fps在神经网络上运行《毁灭战士》。对物理精度要求低,但服务成本高昂(Genie 3每小时约100美元)。
策略评估是机器人领域近期最清晰的价值点。DreamDojo实现r=0.995的相关性,意味着可在世界模型内对20个候选策略排名,而非进行20次昂贵的真机实验。
合成训练数据生成前景可期但边际价值不明。DreamGen展示了一次演示可带来22种新行为,但改进幅度并不显著,信号增益是否超越更多真实数据或数据增强尚存争议。
样本高效学习在受控环境中验证,DayDreamer展示了一小时内从零学会行走,因世界模型可在每次真机尝试间想象数千次练习,但尚未在生产环境中大规模验证。
直接机器人控制是最大胆也最缺乏验证的主张。DreamZero宣称比视觉-语言-动作模型(VLA)基准有2倍泛化提升,但仅来自论文。VLA路线迭代迅速:Physical Intelligence的Pi-0.5泛化到未见家庭环境,Pi-0.6加入强化学习自我改进,Pi-0.7已悄然整合一个小型世界模型用于子目标规划。这场路线之争远未结束。
7. 百亿融资下的冷思考
整个机器人AI领域的成熟度远比融资规模呈现的要低得多。当前生产部署仍主要依赖VLA,而非纯粹的世界模型。NVIDIA用全栈开源构建物理AI时代的“CUDA护城河”;Yann LeCun押注完全绕开像素预测的JEPA架构;Physical Intelligence则在VLA大旗之下默默整合世界模型组件。两种路线的边界,正在加速模糊。
世界模型正站在两条历史悠久的学术脉络的交汇点上,它的承诺真实而巨大,但实现通用物理世界仿真的道路,远比百亿资本所想象的更加漫长。










