CVPR 2026|川大雷印杰团队:给视频生成注入物理定律,过程终于不再“出戏”
导语:川大雷印杰团队CVPR 2026新研究,用事件链和物理规律重写视频生成流程,让画面变化更符合真实世界逻辑。
如果你仔细观察过AI生成的视频,可能会发现一个很微妙的“穿帮”:一勺蜂蜜倒入热茶,本该拉出细长的丝,结果视频里直接断成一截截;一块冰在室温下融化,还没怎么化就凭空消失了;玻璃球掉进水里,本该减速下沉,画面却只给了一个入水瞬间。这些细节正是当前视频生成最容易让人出戏的地方——画面看起来像,但过程不对,缺乏真实世界那种连续演化的逻辑。
随着OpenAI Sora、Kling等模型不断刷新视觉质量的上限,清晰度和风格已经不再是主要瓶颈,但更深层的问题逐渐暴露:模型缺乏对物理规律的理解能力。现有方法大多依赖数据驱动的模式匹配,本质是在生成“看起来合理”的画面,而非模拟真实发生的过程,这在流体、热变化和多物体交互场景中尤为明显。
在这样的背景下,四川大学雷印杰团队提出了一项名为“Chain of Event-Centric Causal Thought for Physically Plausible Video Generation”(以事件为中心的因果思维链用于物理上合理的视频生成)的研究,并被CVPR 2026接收。这项工作不再直接从文本生成视频,而是让模型先理解物理过程本身,将复杂现象拆分成一系列具有因果关系的事件,并结合物理规律进行约束,再逐步生成视频。目标不是让画面仅仅“看起来真实”,而是让变化过程也符合现实世界的运行逻辑,从而在更深层次上提升视频生成的可信度和一致性。
论文地址:https://arxiv.org/pdf/2603.09094
一项更符合“真实世界”的实验结果
研究团队首先在PhyGenBench数据集上进行了系统评估,该数据集包含160条物理描述,覆盖力学、光学、热学和材料四类典型场景。整体来看,该方法取得了0.66的得分,此前最优方法PhysHPO为0.61,绝对提升0.05,相对提升约8.19%。与基础视频生成模型相比优势更加明显:Kling为0.49,Gen‑3为0.51,CogVideoX为0.45,而该方法达到0.66,提升幅度超过30%。
分领域结果中,力学方向得分0.67(此前约0.55),光学0.72(此前0.68),热学0.65(此前0.58),材料0.60(接近最高值0.65),在四个物理领域中有三个排名第一。
更细粒度的分析显示,该方法的优势集中在物理顺序正确性上。在力学场景中,物理现象识别和顺序正确性均为0.79,而对比方法DiffPhy的顺序正确性只有0.53,提升了0.26;光学场景中,顺序正确性从0.66提升到0.85,热学场景从0.58提升到0.69。这说明模型在时间顺序和因果逻辑方面的能力得到明显增强。
在更贴近真实应用的VideoPhy数据集上,该方法同样表现出了出色的泛化能力。该数据集包含688条提示,涵盖固体‑固体、固体‑液体、液体‑液体间复杂交互,评价指标为同时满足语义一致性和物理合理性的比例。该方法取得49.3%,此前最优约45.9%,提升了3.4%;与基础模型CogVideoX的39.6%相比,更是提升了9.7%。尤其在流体相关场景中,提升超过10%,处理连续物理动态的优势显著。
消融实验进一步验证了各组件的贡献:去掉物理公式模块,性能从0.66降至0.62(下降约6%);去掉事件分解模块,降至0.59(下降约11%);去掉文本渐进生成模块,降至0.64(下降约3%);去掉关键帧生成模块,性能直接降至0.55(下降约17%),说明事件链结构和关键帧机制是整个方法的核心支柱。此外,研究还发现事件数量存在最优值:当事件数为4时性能最佳,过少信息不足,过多则误差累积导致性能下降。
从一句话,到一整个物理过程
为了得到上述结果,研究团队设置了统一的实验框架:视频生成模型采用CogVideoX‑5B,输出分辨率1360×768,共161帧;语言推理使用GPT‑OSS‑20B,图像编辑阶段使用Qwen‑Image模型生成关键帧并引导视频生成。
整体流程可以拆解为以下步骤:
- 物理规律识别与检索:输入“蜂蜜倒入杯中”等文本后,模型自动识别涉及的物理领域(如流体力学),并识别出体积变化、连续流动等特征,然后从知识库中检索相关物理公式,用于后续推理约束。
- 事件链构建(PECR模块):完整物理过程被拆分成多个连续事件,如“开始倒入”“接触杯子”“液体逐渐堆积”“液面上升”等。每个事件不仅包含语义描述,还附带高度、体积等物理参数及物体间的空间关系,将连续过程转化为离散的事件序列。
- 语义提示生成:为每个事件生成描述语句,再整合为“首先…然后…最后…”形式的完整提示,确保事件间的因果顺序清晰一致。
- 视觉提示生成(关键帧):针对每个事件生成一张对应图像,并通过图像编辑逐步修改画面,精确控制变化幅度(如液体高度增量),使视觉变化稳定且符合物理过程。
- 插值与视频生成:在相邻关键帧之间插入中间帧,构建连续过渡,再将整个帧序列输入扩散模型,生成最终视频。
在对比实验中,研究采用了相同的文本输入、数据集和评价指标,与普通视频生成模型(Kling、Gen‑3)及物理增强模型(DiffPhy、PhysHPO)进行全面比较,保证了结果的公平性和可比性。
从生成画面,到模拟现实
这项研究的意义,可以从一个很直观的变化来理解:以往的视频生成更像是在“拼画面”,模型只求结果看起来像真实世界,但一旦观察过程,就会发现液体不连续流动、物体运动缺乏前后关系等不合理之处。这些问题本质上是模型缺乏因果关系、时间逻辑和物理规律理解的结果。
雷印杰团队带来的改变,是将视频生成从简单的画面合成转变为对过程本身的建模。原本从文本直接生成图像序列,现在变成先构建具有因果关系的事件链,再基于这条链生成视频。这意味着模型不再只是输出结果,而是开始“经历过程”,在结构上自然引入时间顺序和前后逻辑,使视频更接近现实世界的演化方式。
这种能力提升来自三方面的结合:一是物理约束能力,引入物理公式让生成过程受到现实规律的制约;二是因果结构建模能力,通过事件链明确每一步骤的发生顺序;三是视觉锚点能力,用关键帧约束中间过程,使画面变化连续稳定。三者共同作用,推动模型从“生成看起来合理的结果”迈向“模拟真实发生的过程”。
对于普通用户,这一变化的影响非常直接:未来在短视频创作中,只需简单描述就能生成更真实连贯的动态内容;在教育场景,复杂物理过程(液体流动、光线传播、物体运动)能以视频直观展示;在游戏和虚拟世界,环境变化会更加符合现实规律;在自动驾驶和机器人训练中,这种更真实的模拟能力也有助于模型理解现实环境。
从长远看,这项研究把视频生成从视觉任务提升为物理过程建模问题,为构建更接近真实世界的智能系统提供了基础。不过研究团队也指出,当前方法在面对多个物理规律同时作用的复杂场景时仍有困难(例如牛顿摆与水爆炸同时发生),模型容易失效,说明在组合物理推理方面仍有提升空间,这也为后续研究指明了方向。
推动生成走向“因果”的研究者
本论文的通讯作者雷印杰是四川大学教授、博士生导师,国家级青年人才项目入选者,长期从事人工智能研究。他先后在西南交通大学、四川大学和澳大利亚西澳大学获得学士、硕士和博士学位,2013年加入四川大学电子信息学院,2017年起担任副院长,并入选四川省特聘专家、省学术和技术带头人后备人选,获四川杰出青年科学基金支持。其研究方向聚焦人工智能、计算机视觉及多模态理解,主持和参与多项国家级科研项目及企业合作,在学术研究与应用之间形成了良好的结合。