CVPR 2026 | 普通视频长出“空间感”!港中文薛天帆团队用CubeComposer生成4K全景视频

导语:普通视频如何秒变4K全景空间?港中文薛天帆团队的CubeComposer给出了答案,CVPR 2026的新方法让沉浸式内容创作走向大众。

一、当取景框再也装不下整个世界

我们都曾有过这样的体验:暴雨前翻滚的积雨云从头顶压向地平线,城市地下通道里回声包裹着脚步的压迫感,商场穹顶洒落的光影随视角转动而流淌。可一旦举起手机,这些立体的、环绕的、可转身回望的空间瞬间坍缩成一个窄窄的矩形。我们留下了画面,却弄丢了“身处其中”的感觉。这正是沉浸式内容产业的阿克琉斯之踵——未来视频不应只是被观看,更应允许人们进入、环视甚至停留。VR、数字展陈、虚拟旅游、线上看房领域对360°全景内容饥渴已久,但生产端仍被专业设备、多机位拼接和高昂成本牢牢锁死。当需求已经奔涌,供给却还在用最笨拙的方式一帧一帧缝合世界,行业自然难以真正起飞。

二、CubeComposer:把普通视频“长出空间”

在CVPR 2026上,香港中文大学薛天帆团队提出的CubeComposer,试图回答一个足以撬动行业的问题:能否用最普通、最廉价的视频素材,直接生成原生4K的360°全景视频?不是简单的超分辨率放大,不是边缘模糊的伪360,而是空间连续、时间稳定、逼真可环视的沉浸式体验。这篇题为《CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video》的论文,将原本整体生成、计算量爆炸的全景视频任务拆解成一系列更小的、按顺序逐步完成的自回归补全问题,让“普通视频长出空间”从奢望变为现实。

核心思路精妙而直观:把360°球面视频展开成立方体的六个面(F、R、B、L、U、D),在时间维度上切成多个短窗口,然后像拼图一样,先基于已知的历史与未来信息生成一个面,再用生成好的面作为上下文去预测下一个面,最后将所有面无缝拼接。这种时空自回归模式极大降低了单次生成所需的内存和算力,使4K分辨率生成成为可能。同时,团队设计了包含未来帧的上下文机制来保证时序连贯,通过特殊的连续性位置编码和边缘融合消除拼接裂缝,并引入稀疏注意力进一步削减计算复杂度。三者的结合,让CubeComposer成为目前唯一能在单一消费级GPU上端到端输出4K 360°视频的方案。

三、不只是1K→4K的数字游戏

研究团队在自建的4K360Vid(11,832段原生4K 360°视频)和公开数据集ODV360上进行了详尽评估。指标选用感知相似度LPIPS(越低越好)、语义一致性CLIP(越高越好)、分布距离FID/FVD,以及VBench中的清晰度I.Q.和美观度A.Q.。

相较于此前最强的基线Argus,CubeComposer在4K360Vid上实现全面突破:LPIPS从0.4074降至0.3696,CLIP从0.8858提升至0.9234,FID由141压缩到119,视频稳定性指标FVD从4.07降至3.90。更关键的是,在原生4K输出下,FVD进一步降至2.22,清晰度指标超过0.56,美观度跃至0.40以上——分辨率翻倍的同时,感知质量不降反升。在ODV360上趋势一致,FVD甚至从Argus的12+锐减至3.5,视频连贯性出现质的飞跃。

消融实验揭示了设计的必要性。去除未来帧信息后,FVD从4.25飙升到6.03;去掉位置编码或边缘融合组件,拼接处立刻出现可见裂缝,FID从157恶化到190以上。这些数据从反面印证了CubeComposer在解决360°视频生成最棘手的“不可见区域补全”与“跨面连续性”两大难题上的有效性。

定性对比更直观。传统方法远景模糊、树木建筑如被水渍晕开,运动时画面抖动,拼接区域常出现刺眼接缝,超分辨率后甚至产生油画般的涂抹感。而CubeComposer的输出远景锐度明显更高,相机移动平滑稳定,六个面浑然一体,几乎无法察觉过渡边界。这不仅是量表的优化,更是临场感的根本提升。

CVPR 2026 | 港中文薛天帆团队破局全景视频生成:CubeComposer将普通视频转为4K 360°沉浸式内容

四、一套不止于模型的完整打法

为了训练通用、鲁棒的生成模型,团队精心构建了4K360Vid——利用Qwen-VL自动标注语义描述,并过滤了低质视频,确保每条数据都含有高质量、高分辨率的全景画面及对应的文字说明。训练时,系统模拟真实拍摄场景:从原始360°视频中随机生成一条3~5个关键点组成的相机轨迹(视角范围60°~120°),渲染出普通视角视频作为输入,再将其反投影回球面得到带有大面积缺失区域的360°帧。模型的学习目标就是在已知历史帧、当前帧部分可见区域以及少量未来帧的条件下,逐步补全这些黑洞般的缺失区域。

基础模型选用Wan 2.2 5B视频扩散模型,但在自回归框架下被重新训练。推理阶段,整段视频被等分为多个时间窗口,每个窗口内按F→R→B→L→U→D的顺序逐个生成面的内容。每生成一个新面,系统都会自动聚合所有已生成面的边缘信息作为上下文,再用卷积融合模块消除面与面之间的缝隙。这样球面视频就被一块一块“编织”出来,最后重新拼接成完整的4K 360°输出。

CVPR 2026 | 港中文薛天帆团队破局全景视频生成:CubeComposer将普通视频转为4K 360°沉浸式内容

五、从少数人专享到多数人可及

CubeComposer的真正价值在于它重新定义了沉浸式内容的创作边界。过去制作一段可用的360°视频,要么架设多台相机同步拍摄再费时拼接,要么使用昂贵的全景相机,成本动辄数万甚至数十万元。如今,这项技术指明了另一条路:将来你只需用手机环绕拍摄一段普通视频,AI就能自动补全出整个球面空间。旅途中的街景、家庭聚会的欢笑、教室里的实验演示、博物馆的展览导览,都可能被转化为可转身环视的数字空间。对于VR内容制作者,这意味着素材获取成本将下降一个数量级;对于游戏与虚拟场景生成,环境构建将不再依赖手工建模;对于数字孪生与虚拟旅游,任何一个普通人的随手拍摄都可能成为可交互、可探索的立体档案。技术的进步最终让沉浸式体验不再是少数专业机构的专利,而成为每个人记录、分享和重现世界的新方式。

六、向更完整的视频生成范式迈进

从方法层面,CubeComposer给出了一种“化整为零、分而治之”的生成范式。它不再试图单次输出完整视频,而是将复杂任务拆解为空间维度上的六个面和时间维度上的多个窗口,按时空依赖顺序逐步完成。这种自回归分解策略对高分辨率、高帧率、长序列的视频生成具有普适意义。许多未来的生成任务——如长视频续写、3D世界构建、多视角自由视点合成——都可能从这一思路中获益:大问题不一定需要大模型,精巧的结构设计往往能四两拨千斤。论文中时空上下文、连续性编码与稀疏注意力的结合,也为后续研究提供了可复用的模块化工具箱。

CVPR 2026 | 港中文薛天帆团队破局全景视频生成:CubeComposer将普通视频转为4K 360°沉浸式内容

七、背后团队

论文通讯作者薛天帆博士现任香港中文大学信息工程系助理教授。他本科毕业于清华大学,硕士就读于港中文,后在MIT计算机科学与人工智能实验室师从William T. Freeman完成博士学位,曾于Google Research领导移动影像算法研发,其夜景模式、视频增强等技术广泛落地于终端产品。他在计算摄影、图像视频生成领域发表顶会论文百余篇,累计引用逾万次,获SIGGRAPH、CVPR、NeurIPS等多次奖项。团队近期深耕沉浸式内容生成,致力于用AI为普通人打开全景创作之门。

 

© 版权声明

相关文章