给视频生成装上“物理外脑”:NTU团队提出VChain,用视觉推理解决画面“穿帮”难题

导语:告别穿帮画面!南大团队提出VChain,让视频生成学会像人类一样进行逻辑推理。

当生成画面开始“穿帮”,视频模型真正缺的是什么?

在视频生成领域,我们见证了画面保真度和细腻度的疯狂内卷。从最初噪点密布的粗糙短片,到如今宛如电影大片的逼真渲染,技术跨越令人惊叹。然而,当视线移开那些绚丽的光影,盯着一些物理交互的细节时,问题就接踵而至了:被扔出的石子可能会反弹得像个乒乓球、倒在桌上的水不仅没有蔓延反而凭空消失、两车相撞瞬间车身完好无损地错开……

这就是目前所有基于海量数据驱动的端到端视频生成模型普遍面临的隐痛——它们能精妙地模仿“视觉表象”,却并没有理解真实物理世界的“演变逻辑”。在影视制作、具身智能训练以及物理仿真等对逻辑连贯性要求极高的应用场景中,仅仅生成“平滑的像素”是远远不够的,行业急需的是能够遵循物理因果关系的“逻辑演化”。

面对这一瓶颈,学术界和工业界开始思考:能不能把多模态大语言模型(MLLM)卓越的推理和常识能力,作为一种“外脑”注入到视频生成流程中?

在 ACL 2026 (Findings) 中,来自新加坡南洋理工大学(NTU)的研究团队发表了名为 VChain 的全新框架。该框架尝试将 GPT-4o 等大型多模态模型的视觉推理链条显式拉出,用于规划和指导视频生成,从而在根本上解决视频因果逻辑混乱的痼疾。

  • 论文名称:VChain: Chain-of-Visual-Thought for Reasoning in Video Generation
  • 第一作者:黄子琪 (Ziqi Huang)
  • 共同作者:于宁 (Ning Yu), Gordon Chen, 邱浩楠 (Haonan Qiu), Paul Debevec, 刘子纬 (Ziwei Liu)
  • 项目主页:https://eyeline-labs.github.io/VChain

“脑子好使”的大模型,如何拯救“四肢发达”的扩散器?

视频模型之所以“物理不及格”,根源在于其学习模式。它是在庞大的视频数据集中寻找像素之间的统计关联,而不是学习牛顿力学或化学反应。于是,羽毛可能落得比石头还快,因为它在“模仿”某种下落运动,却不知道质量和阻力的关系。

相比之下,以 GPT-4o 为代表的多模态大模型在文字与图像层面的常识推理早已炉火纯青。但如果直接让这些庞然大物去逐帧输出视频,不仅算力成本高昂得无法承受,生成画面的稳定性和质量也难以保证。这就好比让一位熟读物理定律的思想家强行去做精巧的手工活,往往心有余而力不足。

【VChain让视频更符合物理规律】视频生成大模型技术

VChain 做出了一个非常务实的架构抉择:“让专业的人做专业的事”。大模型不用亲自去画视频的每一帧,而是作为“推理器(Reasoner)”,在脑海中梳理好事件演变的关键步骤与视觉节点;视频扩散模型则作为“渲染器(Renderer)”,负责把大模型梳理好的骨架去填充像素、细化动态。这种解耦方式不仅高效,而且完全在推理阶段完成,不需要对参数庞大的底层视频生成模型展开重新训练。

三大核心战术:拆解 VChain 动作分解链路

为了在不重训模型的前提下注入复杂的逻辑能力,VChain 构建了一套优雅的三阶段推理范式。

第一步:视觉思维推理(Visual Thought Reasoning)

当用户输入一个富含因果逻辑的 prompt,比如“将浓硫酸倒在木桌上”,普通的模型可能会直接生成一摊黄色的水,而忽视了物质反应。VChain 遇到此类任务时,会率先调用 LMM 进行多轮迭代的“推演”。

大模型在脑海中演练动作变化:“起初,装有溶液的烧杯倾斜在木桌上方;紧接着,透明液体倾泻而下;随后,液体接触木质表面并开始冒泡;最终,桌面受蚀产生明显的焦黑炭化痕迹。”大模型不仅会写下这一串文字步骤,还会为每一个核心节点预测并生成一张精准的静态关键图像。这些图文并茂的中间状态,便构成了该事件独特的视觉思维链 (Chain of Visual Thoughts)”

第二步:推理时稀疏调优(Sparse Inference-Time Adaptation)

如果把大模型脑补出的这几张关键骨干图直接交给视频模型去插帧,往往会导致画面出现严重的抖动甚至崩坏。VChain 的解决办法极为聪明:它并没有把这几张图强行塞进视频中去拼凑,而是将其视为一种稀疏的“行为规范”

模型在推理阶段,利用这些大模型给出的关键帧和对应的文案描述作为临时的强监督信号,通过极小量级的 LoRA 模块调整视频生成模型的相关参数。这个微调过程非常轻量,只聚焦于将原模型的某些先验知识“校准”到这次任务的物理轨道上,计算开销得到了有效克制。

第三步:联合级联视频采样(Video Sampling)

在经过微小的调整后,视频生成模型已经对整个场景中将要发生的物理演变有了清晰的预判。最后,VChain 会把整个视觉思维链中的文字描述顺次连接,拼成一条具备时序关联性的完整逻辑提示词,驱动微调后的视频生成模型,一次性渲染出帧与帧之间过渡顺滑、物理规律高度可信的完整视频短片。

实测对比:从“应付差事”到“有板有眼”

为了验证 VChain 能否真正治好视频生成的各类逻辑硬伤,研究团队开展了详实的量化与质性对比测试。

在传统的视频模型生成“保龄球击倒球瓶”的测试中,常规模型表现得很是敷衍:球滚过去,瓶子要么纹丝不动,要么发生了违背常理的缓慢倾斜,仿佛球和瓶子处在两个维度。即使为原模型加塞一些提示词进行指令增强,生成的画面动态依旧非常扭曲,甚至会出现奇形怪状的物理拉伸。

而在注入 VChain 的框架后,生成的视频细节迎来了质的蜕变:保龄球划过合理的弧线抛掷而出,狠狠砸向瓶身,球瓶瞬间四散炸裂。无论是反弹轨迹的合理度,还是木质材质在整个动态过程中的结构自洽性,都挑不出硬伤。

定量的消融实验数据进一步巩固了这一方案的科学底座。如果剔除“视觉思维链”步骤,生成模型虽然知道要生成哪类视角的视频,但是在面对精细动作(如双手接球)时,其内部空间感会有所缺失;而如果撤走“稀疏调优(Adaptation)”直接粗暴插值,视频中间则会涌现出大量恼人的杂质和形变噪点。事实表明,大模型的逻辑推理和视频生成模型微调的耦合,缺一不可。

走向“Reasoner-Renderer”协作:视频生成范式迎来迭代

从 VChain 的演变路径中,我们能够清晰地读出未来多模态AI演进的两个技术走势:

其一,逻辑推理正从“纯文本的局限”突破至“去符号的视觉表征空间”。在解决物理规律、三维空间变换这类难以用干瘪语言陈述的复杂物理场景时,单纯依赖语言大模型的文字描述(Textual Prompt)有着天然的短板。VChain 构建的“图像思维节点”为视频生成器锁定了视觉层面的锚点,真正实现了动作概念与像素填充的统一。

其二,模块化分工取代野蛮粗暴的单一端到端架构。随着大模型在推理层面的天花板不断抬高,将逻辑理解与像素渲染解耦、各自独立迭代的发展轨迹,无疑更加符合系统设计的工程美学。未来的 AI 系统或许不需要在一个庞大的视频模型里强塞下世界万物的运行规律,而是通过巧妙的框架,让一个聪明的“大脑”指导一双善于作画的“双手”。这正是 VChain 为行业开创的一条极富启发性的前行之路。

© 版权声明

相关文章