CVPR 2026 世界模型路线图:从像素幻象走向物理法则的8项重磅突破

导语:CVPR 2026成为世界模型研究的转折点,从4D几何到物理因果,多项工作推动视频生成从“拟合像素”迈向“建模世界”。

过去几年,视频生成在视觉质量上高歌猛进,但一个根本性追问逐渐浮出水面:模型究竟是在“理解世界”,还是仅仅在“拟合像素分布”?传统2D逐帧生成方法在相机控制、多物体交互、长时序一致性上频频露怯,根源在于缺乏对空间结构、时间演化和物理规律的显式建模。CVPR 2026 成为这一转折的集中展台,一系列工作将研究重心从“生成看起来真实的结果”推向“建模本质上合理的世界”。本文从4D几何表示、物理因果学习、精确控制、交互决策到统一评测,系统梳理这些关键进展,看世界模型如何从生成工具进化为世界模拟器。

从2D像素到4D几何:世界模型的表示革命

传统视频生成在2D图像空间建模,难以统一控制相机与物体运动,且长时间生成易结构漂移。几项新工作不约而同地将世界“升维”,用4D几何几何(3D空间+时间)刻画场景本质。

VerseCrafter:用4D几何控制打造动态真实世界

复旦大学、香港大学与腾讯ARC提出的《VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control》[PDF],直指2D建模的痼疾。其核心是引入“4D Geometric Control”表示:用静态背景点云描述场景结构,用带时间信息的3D高斯轨迹描述动态物体,构建统一的4D世界状态。几何信息随后转化为扩散模型的控制信号,迫使生成视频严格遵循设定的相机路径和物体运动。这一设计实现了从像素合成到结构生成的范式转变,相机与多物体运动得以统一控制,时序一致性和长时间稳定性显著提升。

NeoVerse:从随手拍的单目视频构建4D世界

中科院自动化所与CreateAI的《NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos》[PDF],突破了对多视角数据或复杂预处理的依赖。模型直接从野外单目视频中恢复3D结构并建模动态信息,获得完整4D表示,同时支持4D重建和新视角生成。该方法大幅提升了可扩展性,使4D建模能够利用海量真实视频,泛化能力更强。

LongStream:面向长序列的流式3D重建

当视频长度达到上千帧,传统自回归3D重建的注意力衰减、尺度漂移和误差累积会急剧放大。港科大(广州)、地平线、浙大与中南大学联合提出的《LongStream: Long-Sequence Streaming Autoregressive Visual Geometry》[PDF],通过“规范解耦”策略打破困境:将尺度学习与几何预测解耦,并采用关键帧相对建模,让每段局部序列独立估计、再统一到全局结构。配合周期性缓存刷新和流式更新,模型在严格在线条件下可稳定处理超长视频。这项工作将世界模型推向自动驾驶、AR/VR等对持续环境建模有刚需的场景。

CVPR 2026世界模型论文盘点:4D几何、物理因果与交互控制新突破

从生成到理解:学习可迁移的物理世界知识

视觉逼真只是起点,世界模型的核心竞争力在于能否掌握可迁移的物理规律。以下三篇论文分别从知识学习、物理对齐和因果推理切入,让模型从“会生成”走向“会理解”。

VideoWorld 2:从真实视频中提取可迁移知识

北京交通大学与字节跳动的《VideoWorld 2: Learning Transferable Knowledge from Real-world Videos》[PDF],不依赖人工标注,通过观察海量无标注视频中的动态过程,自主学习物理规律、物体交互与时间变化,并将其编码为可复用表示。这使得模型不仅生成逼真画面,更能将视频内蕴含的知识迁移到新任务。研究重心从外观生成转向知识提取,让视频模型初步具备了“理解现实”的能力。

ProPhy:渐进式物理对齐让模拟更真实

中山大学与鹏城实验室的《ProPhy: Progressive Physical Alignment for Dynamic World Simulation》[PDF],针对视频生成中物理错误频发的问题,提出渐进式物理对齐机制。模型先用语义层提取文本中的运动类型等物理规律,再在细粒度空间将它们精确对齐到视频的特定区域和时间段。配合“物理专家混合”结构,不同模块分工学习各类物理现象,并引入视觉语言模型的推理能力,使生成结果不仅视觉逼真,更是物理合理的动态过程。

事件链因果思维:让物理过程环环相扣

四川大学、港理工、电子科大与阿德莱德大学的《Chain of Event-Centric Causal Thought for Physically Plausible Video Generation》[PDF],将复杂物理现象建模为一系列有因果顺序的事件链。通过“物理驱动的事件链推理”将过程拆解为子事件,并用物理公式硬约束其关系;再通过“跨模态过渡建模”转化为时间对齐的文本和关键帧提示,引导扩散模型生成平滑、因果一致的动态视频。这一框架让视频生成从“抓拍瞬间”变为“讲述过程”,在液体流动、能量变化等富有挑战的场景中物理一致性明显胜出。

CVPR 2026世界模型论文盘点:4D几何、物理因果与交互控制新突破

精确控制生成世界:从相机轨迹到长视频增强

世界模型不仅要建得准,还要可控。新范式下的控制方法不再以牺牲质量为代价,甚至无需重新训练。

WorldForge:零样本相机控制释放3D/4D潜力

西湖大学与南洋理工的《Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control》[PDF],提出即插即用的WorldForge框架。它在推理阶段对预训练视频扩散模型进行三重修修补:去噪过程中递归优化贴近目标相机轨迹;用光流在潜空间分离运动和外观,仅控制运动部分;双路径对比机制自动校正轨迹漂移。完全无需训练,成本极低,同时实现精准的相机控制与高质量输出,可通用于不同模型和3D重建、4D生成、视频编辑等任务。

FreeLOC:不用重训练,让短视频模型稳定生长视频

西湖大学另一项工作《Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction》[PDF],则瞄准长视频生成的分布外问题。短视频模型直接生成长视频时,帧间相对位置和上下文长度超出训练分布,导致质量崩塌。FreeLOC通过视频相对位置重编码将时间位置拉回熟悉范围,分层稀疏注意力平衡局部细节与长程依赖,并让层自适应探测只对敏感层修正,在零训练成本下大幅提升长视频的视觉质量与时序一致性。

CVPR 2026世界模型论文盘点:4D几何、物理因果与交互控制新突破

世界模型的交互与决策:从模拟迈向行动

世界模型若不能参与决策,价值将大打折扣。以下工作将生成与规划统一,或直接支持动作控制,让模型“用世界做事”。

DriveLaW:在统一潜空间里边预测边决策

华中科技大学与小米EV的《DriveLaW: Unifying Planning and Video Generation in a Latent Driving World》[PDF],打破自动驾驶中“预测—规划”分离的惯常结构。模型在潜在驾驶世界中同时学习场景动态演化和运动规划,决策直接在潜空间进行,避免先生成完整视频再规划的中间损耗与误差累积。一体化的框架在长时预测和复杂场景下鲁棒性更强,让世界模型真正成为决策引擎。

ABot-PhysWorld:具物理约束的机器人交互世界模型

AMAP CV Lab的《ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment》[PDF],基于大规模扩散Transformer,在生成机器人操作视频时显式引入物理约束,避免物体穿透、违反重力等典型错误。模型支持动作可控生成,并采用物理感知训练与偏好优化,让生成过程兼顾视觉真实感与物理合理性,为世界模型在机器人操作中的落地铺路。

SimScale:用真实数据驱动仿真,规模化生成长尾场景

中科院自动化所MAIS Lab、港大OpenDriveLab与小米EV的《SimScale: Learning to Drive via Real-World Simulation at Scale》[PDF],直击自动驾驶关键危险场景数据稀缺的痛点。从真实数据提取场景结构,在仿真环境中扩展出未见状态并自动生成驾驶轨迹作为监督信号,再与真实数据联合训练。该方法有效弥合仿真与现实的差距,可无限扩展长尾场景数据,模型性能随仿真规模持续提升,显著增强安全性与泛化能力。

CVPR 2026世界模型论文盘点:4D几何、物理因果与交互控制新突破

评估世界模型:我们真的在建模世界吗?

当模型纷纷标榜“世界模拟”,一套统一、多维度的评测体系成为紧迫需求。同时,新的建模方法也在推动评测的进化。

4DWorldBench:3D/4D世界模型的全面体检

中科大、浙大与北京智源研究院的《4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models》[PDF],构建了首个统一评测框架,从视觉感知质量、条件对齐、物理真实感、时空一致性等维度系统衡量。它支持文本、图像、视频等多种输入,并引入大语言模型参与评估,使结果更贴近人类判断,让不同模型可公平比较。工作重心从“生成是否好看”转向“是否真的理解时空”。

WorldLens:驾驶世界模型的全频谱扫描

WorldBench Team的《WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World》[PDF],专为自动驾驶设计评估体系,涵盖生成、重建、动作跟随和下游任务表现,并融合人类偏好与自动评估。大规模数据集和可解释的自动评分,不仅发现了当前模型不同能力间的明显权衡,也为后续改进指明了方向。

GeoWorld:在几何空间中长时规划

ANU与MBZUAI的《GeoWorld: Geometric World Models》[PDF],跳出欧几里得空间,在潜在空间中构建能量模型并引入双曲几何表示,更自然地刻画状态间的层级结构。预测和规划通过沿测地线推理而非逐状态生成,显著缓解长时误差累积,为基于世界模型的决策规划提供了几何新范式。

Neoverse:无姿态的单目4D世界建模

作为对NeoVerse工作的延续与深化,中科院自动化所与CreateAI的《Neoverse: Unposed 4D World Modeling from Monocular Video》[PDF],进一步提出无姿态的前馈式4D重建与生成联合框架。训练时模拟在线退化,让模型学会从低质量渲染恢复高清新视角。整套流程无需复杂预处理,可在大规模单目视频上端到端训练,将4D世界模型的扩展能力和实用价值推上新高度,同时支持视频编辑、稳定、超分辨率等多种下游任务。

从4D几何控制到物理因果推理,从零样本相机操控到统一潜空间的决策规划,再到多维度评测体系的确立,CVPR 2026 的世界模型研究呈现出清晰的演进脉络:让模型从“像素的魔术师”转变为“世界的解读者与模拟器”。当生成不再是对视觉分布的简单拟合,而是对空间、时间、物理规律的深层建模,通用世界模拟器的地基正在被一块块扎实地夯实。

© 版权声明

相关文章