CVPR 2026 | 让视频生成遵循物理法则:ProPhy的分层物理对齐方法

导语:ProPhy通过语义与空间双层物理专家和视觉语言模型监督,让视频生成学会遵循物理法则,显著提升动态场景的物理合理性。

引言:视频生成的物理可信度危机

试想一个机器人伸手拿桌上的杯子,刚抬起又放下,然后再次伸手——它好像忘了自己已经做过的事。类似的“反物理”行为在近年火爆的视频生成模型中也屡见不鲜:按钮已按下却仍在反复按,抽屉已关好却还在推。过去两年,视频生成在视觉质量上飞速逼近真实世界,从模糊片段到长序列叙事,光影纹理近乎完美。但一个更深层的缺陷正逐渐暴露:模型生成的画面越来越像真的,却经常违背基本的物理规律。物体移动缺乏连续动力,接触关系模糊甚至穿透,流体与布料变化只模仿外观模式而非真实物理约束——这些都不是数据量的不足,而是模型缺少对因果与空间约束的建模能力。

中山大学梁小丹团队在CVPR 2026发表的《ProPhy: Progressive Physical Alignment for Dynamic World Simulation》尝试系统性地解决这一难题。ProPhy不再依赖单一物理提示,而是通过分层建模与逐步对齐,将物理信息从全局语义细化到局部空间,并创新地引入视觉语言模型(VLM)作为“教师”,将VLM的空间理解优势转化为生成模型的物理定位监督信号,使模型不仅知道“发生了什么”,更理解“发生在哪里”。

ProPhy:一条从语义到空间的物理建模链路

ProPhy的核心是分阶段注入物理知识:先从文本中提取视频包含的物理现象类别,再在生成过程中对每个位置(token)赋予具体的物理属性,最后利用VLM提供的空间标注进行对齐训练。

语义级物理模块(SEB):确定视频“涉及哪些物理”

SEB由32个物理专家组成,每个专家对应一种物理模式(如燃烧、流体、碰撞等)。当输入一段文本时,路由器会为这些专家分配权重,输出一个混合的物理先验向量。SEB本质上是一个物理分类器与权重分配器的结合,从全局层面确定视频的物理属性,避免将不同现象混为一谈。

空间级物理模块(REB):定位“物理发生在哪里”

同一视频中往往同时存在多种物理现象(如左侧火焰、右侧水流),因此ProPhy设计了token级别的物理建模模块REB。对每一个位置token,REB会选择与它最相关的top-k个专家进行计算,最终得到一个空间物理分布图——每个位置对应一种物理现象。这使得模型能够在空间上区分不同的物理过程,显著提高生成视频的局部物理一致性

VLM监督:教生成模型“看”到物理区域

研究发现,视频生成模型自身难以精确判断物理现象的边界,而视觉语言模型(VLM)在这方面表现更强。ProPhy利用VLM为REB提供伪标签:向VLM提问“燃烧在哪里?”,获取注意力高亮区域;再询问“背景是什么?”,得到背景区域;两者相减即获得纯净的物理区域。通过这种方式,得到每个token属于各物理类别的概率矩阵,用来监督REB训练,使其学会在空间中定位物理现象。

训练目标与消融验证

ProPhy设计了三个损失函数:Lcoarse鼓励同类物理样本表征相似,不同类分离;Lfine-align使token级预测接近VLM标注;Lfine-balance防止少数专家被过度激活。三者权重分别为0.1、0.02、0.01。消融实验表明,去除REB会导致空间物理建模能力丧失,去除SEB则物理分类性能骤降,去除对齐机制则训练不稳定——三个组件缺一不可,递进协作。

此外,通过分析专家间的相关性,发现燃烧与爆炸专家高度相关,而爆炸与折射则相关性较低,印证了模型不仅学会单一现象,还捕捉到了物理过程之间的结构关系。

实验:从“看起来真实”到“物理上正确”

用VideoPhy2评测物理合理性

不同于普通视频评测,ProPhy采用专门面向物理合理性的VideoPhy2基准,关注三个指标:PC(物理常识)衡量是否符合重力、碰撞等基本规律;SA(语义遵循)判断是否完成文本描述的物理任务;Joint为同时满足PC和SA的比例,是综合物理与语义的硬指标。

定量提升:物理违规显著减少

  • Wan2.1(1.3B)模型:原始PC仅57.8,加入ProPhy后提升至65.0(+7.2),SA从30.0微升至32.0,Joint从24.8升至26.5。PC的大幅提升直观反映模型减少了水往上流、物体穿透等错误,而SA提升有限说明ProPhy主要增强物理正确性而非语义理解。
  • CogVideoX模型:Joint从22.3提高至26.7(+4.4),超越WISA与VideoREPA等方法,证明ProPhy在不同参数量模型上均有效。
  • HARD子集(多物体交互、高速运动等极难场景):Wan2.1的Joint从5.6提升至7.2,CogVideoX从5.0到6.1。尽管绝对数值低,但在高难度物理推理任务上展现显著改进。
  • VBench视频质量:动态程度由46.8跃升至72,总体质量评分从76.8升至81,说明符合物理规律的动态更自然、画质更真实。

定性案例:从猜测到理解因果

多个案例揭示了ProPhy学习到了物理因果关系:

  • 扬尘场景:基线模型球未落地就出现灰尘,而ProPhy只在球接触地面后才扬起尘土,符合“接触导致结果”的逻辑。
  • 碰撞场景:基线常出现穿透或静止,ProPhy则表现出动量传递——小球被撞击后开始运动,隐含学习了动量守恒。
  • 流体场景:ProPhy生成的水流更符合重力与容器约束,而非单纯的纹理流动。

这些结果表明模型开始摆脱对视觉模式的死记硬背,转而遵循物理规则。

未来展望:面向动态世界的一种建模尝试

ProPhy的意义不止于性能提升——它标志着视频生成从“再现视觉现象”向“近似世界运行机制”的转变。通过将物理从隐式统计规律转化为显式知识结构,并实现空间级区分,模型具备了初级的因果理解能力。这为机器人训练、自动驾驶仿真、虚拟环境构建等需要真实物理交互的领域打开了可能。

从普通用户的角度,更符合物理规则的视频生成工具将减少动态内容中的违和感,提升影视、游戏、教育演示的逼真度。然而,研究人员也指出ProPhy仍依赖VLM标注(存在噪声),且学习的是表层物理模式而非严格方程,属于近似模拟。未来将探索嵌入物理方程与更强的因果建模,使视频生成真正成为可靠的世界模拟器。

团队简介

论文第一作者王子俊是中山大学智能工程学院博士生,师从梁小丹教授。博士后胡攀文现任职于MBZUAI,黎汉汇为中山大学特聘研究员。通讯作者梁小丹教授长期从事视觉语言理解与生成研究,谷歌引用超3万次,曾获ACM中国最佳博士论文奖等荣誉,其成果已应用于DeepSeek、字节跳动等知名企业产品。

 

© 版权声明

相关文章