公里级场景3D重建不再漂移!Scal3R让长视频稳如泰山

导语:Scal3R用统一的长序列训练与推理框架,首次让公里级场景的3D重建不再漂移,轨迹误差和点云精度全面碾压现有方法。

Scal3R:用Test-Time Training实现公里级长视频3D重建,轨迹漂移锐减70%

长视频3D重建最担心的问题,往往不是“看不清”,而是“稳不住”。当拍摄序列从几十帧拉长到几百上千帧,局部重建再完美,误差也会像滚雪球一样越积越大,最终导致整个场景的相机轨迹和点云严重漂移。浙江大学的科研团队联合地平线机器人与之江实验室,推出全新方法 Scal3R,直指这一痛点:通过让模型在训练时直面超长序列,并在测试时保持同样的行为模式,首次在公里级大规模场景上实现了稳定、高精度的三维重建。

长序列重建的困境:训练与推理的割裂

当前的前馈式3D基础模型(如VGGT)已能从RGB图像直接估计相机参数、深度和点云,精度可观。但场景尺度一扩大,序列长度急剧增加,两个核心矛盾立刻凸显:

  • 计算爆炸:Transformer处理全序列注意力时,计算量和显存随长度平方级增长,动辄数百帧的室外场景直接导致资源耗尽。
  • 训练-测试鸿沟:模型在训练时通常只见过短序列或局部窗口,而测试时需要吞下上千帧。这种错位让长程漂移被急剧放大,推理轨迹逐渐偏离真值。

当前应对方案大致有两种:一是压缩token,将更长序列硬塞进模型,但这会损失细节和长程依赖;二是分块(chunk-based)处理,将序列切分成重叠片段,各自重建再对齐。后者的扩展性更好,但前提是每一块的局部几何预测必须足够精准,否则块间误差会继续叠加。显然,问题的关键不仅是“怎么处理长序列”,而是“如何让模型训练时就学会处理长序列”,并在测试中用同一套机制保持全局一致性。

Scal3R:用Test-Time Training对齐长序列训练与推理

Scal3R没有简单地切开再拼合,而是将长序列训练、逐块更新、跨块同步纳入统一框架,借用Test-Time Training(TTT)的思路,让模型从训练第一步起就适应长视频的连续处理。

Scal3R:用Test-Time Training实现公里级长视频3D重建,轨迹漂移锐减70%

Scal3R整体框架:输入长序列被切分为多个重叠chunk并行处理,通过全局上下文记忆与同步机制保证长程一致性

其核心由两个模块构成:

全局上下文记忆模块(GCM)

GCM由一组轻量、可更新的自适应存储单元组成。每处理完一个chunk,模型通过自监督目标更新这些单元,从而在chunk之间累积并保留上下文信息。这不仅使训练和推理以同一套逐块更新的方式运行,更让模型从一开始就在长序列条件下学习如何利用历史信息。

全局上下文同步机制(GCS)

长序列被分配到不同GPU上并行处理多个chunk。GCS利用PyTorch DDP的all-reduce机制,在不同chunk之间同步GCM的自监督梯度。这样,每个chunk的更新都能彼此影响,确保网络虽然分块计算,但仍在学习如何将局部结果无缝融入长序列整体。

借助GCM与GCS,Scal3R将TTT从测试阶段的临时补丁,转变成了贯穿训练与推理的对齐方式。模型在训练时反复经历“长序列→分块处理→逐块更新→跨块同步”的流程,测试时遇到的行为模式与训练完全一致,从根本上避免了长程漂移。

长序列稳住了:公里级场景的重建表现

论文在相机位姿估计和三维重建两方面进行了全面评估,覆盖室内外多种尺度场景,结果均取得显著进步。

相机位姿:轨迹误差大幅降低

Scal3R:用Test-Time Training实现公里级长视频3D重建,轨迹漂移锐减70%

在KITTI Odometry上,Scal3R将ATE(绝对轨迹误差)从VGGT-Long的25.94m降至14.55m,RTE(相对平移误差)从9.67降至4.61,RRE(相对旋转误差)从1.71°/100m降至0.97°/100m。在Oxford Spires这种长距离室外场景中,ATE更是从15.46m直降至4.45m。轨迹可视化图清晰显示,Scal3R的预测轨迹(蓝线)几乎紧贴真值(红色虚线),而其他方法则容易出现局部漂移或整体偏斜。

多场景轨迹对比,Scal3R(蓝线)几乎与真值(红色虚线)重合

三维重建:点云精度全面领先

在ETH3D、Oxford Spires、VKITTI2三个数据集上,Scal3R的Chamfer Distance和F1指标均为最优。例如,在Oxford Spires上,Chamfer Distance从VGGT-Long的3.41猛降至0.96,F1从0.80升至0.96;在VKITTI2上,Chamfer Distance从1.78降至0.40,F1从0.70升至0.91。定性对比图中,Scal3R重建的建筑轮廓清晰,墙面和门框边缘规整,而其他方法则可能出现局部破碎、结构发糊等问题。

资源与可扩展性:单卡可跑,线性增长

Scal3R可在单张RTX 4090上完成推理,虽非吞吐最快的方案,但在精度与效率间取得了务实平衡。补充实验显示,当序列从150帧增长到990帧时,运行时间基本呈线性上升,而相对位姿误差稳定在0.07~0.08m,证明其能适应不同长度的场景,不会因序列变长而失控。

启示:长视频3D重建的新范式

Scal3R的价值不只在于刷新了各项指标,更在于它重新审视了问题的根源:要想让模型在测试时稳得住长序列,训练阶段就必须让它真正学习过长序列。它没有盲目堆砌更大的backbone或更激进的压缩技术,而是将局部几何估计、可更新上下文、长序列训练与测试时同步有机串联,为大规模3D视觉任务提供了一套可扩展的框架。这一思路不仅适用于3D重建,也为更广泛的长视频场景理解带来了启发。

如果你正在攻关长视频高质量重建、基础模型向公里级场景的扩展,或者希望将Test-Time Training真正落地于3D视觉,Scal3R无疑是一份值得细读的扎实工作。

论文:Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction
主页:https://zju3dv.github.io/scal3r/
代码:https://github.com/zju3dv/Scal3R
模型:https://huggingface.co/xbillowy/Scal3R

© 版权声明

相关文章

暂无评论

none
暂无评论...