不重训练!西湖大学张驰团队WorldForge实现零样本相机控制,视频生成进入4D时代 | CVPR 2026亮点

导语:西湖大学张驰团队在CVPR 2026提出WorldForge,不改变模型参数便实现零样本相机控制,让视频生成具备空间一致性。

过去两年,视频生成的发展近乎指数级跃迁,从模糊片段到叙事长视频,行业表面已近成熟。但若将标准从“能否生成”升级为“能否控制镜头”,问题便暴露无遗:现有模型仍困于二维范式,擅长延续视觉模式,却缺乏稳定的空间建模能力。视角一变化,物体几何便漂移、建筑扭曲、遮挡混乱,生成的不是被持续观察的世界,而是一系列视觉相似但空间不一致的结果。

WorldForge:在推理中注入空间约束

在CVPR 2026上,西湖大学AGI Lab张驰团队提出《Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control》,该工作入选CVPR Highlight。不同于重新训练模型来引入控制,WorldForge在不改变模型参数的前提下,将相机轨迹作为推理阶段的约束条件,驱动每步生成持续对齐同一空间结构。这意味着,视频模型从“能生成画面”的二维合成器,升级为“可移动摄影机”的三维动态世界建模器。

论文地址:https://arxiv.org/pdf/2509.15130

跨任务、多指标的统一性能提升

团队在3D静态场景生成(单图到多视角)任务中验证,WorldForge的FID低至96.08(降幅约20%),CLIPsim高达0.948,为所有方法最优。对比之下,TrajectoryCrafter的FID为111.49,NVS-Solver为118.64。在轨迹精度上,ATE仅为0.077,约为ViewCrafter的1/3,RPE-R为0.221,远低于NVS-Solver的1.056,整体轨迹误差降低2~5倍

在4D动态视频任务(输入视频重指定轨迹)中,WorldForge的FVD低至93.17(对比ViewExtrapolator的108.48,提升约15%),CLIP-Vsim为0.938最高,ATE为0.527,约为ViewExtrapolator(1.040)的一半,在动态条件下依然保持稳定控制。

实验覆盖40+场景、70+单图输入(含LLFF、Tanks & Temples、MipNeRF 360及真实/AI图片),4D任务覆盖30+视频和50+测试样例(DAVIS、电影片段、生成视频),充分验证泛化能力。主模型为Wan2.1 14B,需至少69GB显存GPU,推理采用50步采样,IRR作用于前20步。

消融实验:每个模块贡献10%~20%

完整模型FID 96.08、FVD 93.17为最佳。移除DSG后,FID升至109.43,FVD升至95.69;移除FLF后,FID进一步升至112.69;两者均移除则FID达113.12。若用传统CFG替换DSG,FID恶化至120.91。可见结构感知式控制(DSG)与流引导滤波(FLF)存在明显互补,任一缺失都会导致约10%~20%的性能退化。

可迁移、可控制的生成流程

WorldForge展现出模型无关性:在Wan2.1 14B、SVD、LongCat-Video三个能力迥异的模型上均可直接迁移使用。推理流程采用精细化时间调度:IRR集中作用在前20步(占总步数35%~45%),建立整体结构与运动趋势;FLF在初期关闭以保留全局信息,中后期针对运动相关通道施加约束,平衡结构稳定与细节保真。

方法支持圆弧(arc)、推进(dolly)、环绕(orbit)及自由探索等多种相机路径,应对不同几何形式、运动幅度和遮挡情况。评价体系上,因3D任务无真实参考,选用FID衡量分布层真实感、CLIP相似度评估语义一致性;4D任务增加FVD和CLIP-Vsim,聚焦生成质量与时间连续性,而非像素级重建。

从结果优化到过程控制的转折

WorldForge的核心贡献在于改变视频生成的发展方向:不是不断重训更大模型,而是在推理中实现精准控制。传统CFG因缺乏结构理解而失败,DSG却能将FID从120压至96,证明视频生成需要真正理解空间与运动关系。FLF实验也首次揭示,latent空间通道存在功能分化——有的侧重运动,有的侧重外观。

方法虽强,但成本不低(70GB显存、多路径推理),目前更像高质量离线渲染方案,距实时化尚有距离。然而它指向的未来十分清晰:普通人用一张图或一段视频,就能生成电影级镜头,旅游记录、毕业纪念、短视频创作将变得轻而易举;内容创作者无需专业设备或建模,通过重设计镜头轨迹即可获得团队级的视觉表达能力。这项工作证明了“可行”,而非“已产品化”,但它正将视频AI从二维合成推向空间理解的奇点时刻

WorldForge背后的科研力量

第一作者宋晨曦,西湖大学AGI Lab博士后,师从张驰教授,2024年吉林大学博士毕业,深耕3D/4D场景建模与可控视频生成,同时担任NeurIPS、CVPR等顶会审稿人。代表作包括CVPR 2026的WorldForge、IEEE T-CSVT的FewarNet等,研究路径从多视角重建向训练自由的世界模型延续。个人主页:https://chenxi-song.github.io/

通讯作者张驰,西湖大学助理教授、独立PI,AGI Lab负责人。曾任腾讯研究科学家,南洋理工大学博士,连续入选斯坦福全球前2%科学家榜单,担任ICML、ICLR、CVPR等会议Area Chair及IEEE T-CSVT副编辑。团队成果涵盖扩散模型、多模态生成、智能体系统,代表作如Ultra3D、FlowDirector、Metric3D、StableLLaVA等,形成从视觉理解到世界建模的系统性路线,强调生成模型的可控性与多模态融合。个人主页:https://icoz69.github.io/

© 版权声明

相关文章

暂无评论

none
暂无评论...