扔掉高昂的3D标注!Wayve用千万段“白嫖”视频,把相机姿态估算逼出了新高度
导语:Wayve在CVPR 2026展示了LA-Pose,无需天价3D数据,靠看千万段视频就能学会定位。
车辆在复杂的城市峡谷里穿行,要搞清楚自己每一秒到底怎么动的——平移了几厘米,旋转了多少角度——这件看似出于人类直觉的事情,一直是自动驾驶几何感知底座里最坚硬的骨头之一。
为了攻克相机位姿估计(Pose Estimation)这个坎,行业过去的通用解法基本都在拼资源:攒昂贵的LiDAR车队、做高精度的离线三维重建、甚至在仿真世界里疯狂刷数据。但数据质量越高,成本堆叠就越恐怖。高昂的前期预算直接锁死了模型去往更多城市、应对极端天气的底气。模型最终学到的,不过是那几个特定数据集画下的条条框框。
Wayve 在入选计算机视觉顶会 CVPR 2026 的最新研究中,甩出了一个跳出固有视角的解法。这篇名为 LA-Pose: Latent Action Pretraining Meets Pose Estimation 的论文,抛弃了对海量3D真值(Ground Truth)的执念。研究者直接把目光投向了那些最容易获取、数量也最庞大的普通行车视频。利用自监督学习,模型仅靠看懂千万段未标注的图像序列,就自己琢磨出了相机位姿的运动法则。
第一阶段:像人类司机一样,在没有标定板的画面里“悟”出运动
把一堆杂乱无章的原始行车记录仪录像丢给电脑,它能看出什么?LA-Pose 团队的做法是把整个链路拆成两个核心步骤:先学运动特征,再微调位姿表达。

在第一阶段的“潜在动作预训练”(Latent Action Pretraining)中,团队喂给模型约 1000 万段完全没有进行过几何标注的驾驶视频片段。模型在这一阶段不需要了解车辆的具体轮距,也不需要知道相机传感器的物理参数。它背后运行的是一套精心设计的“逆向-正向动力学系统”。开发团队强迫网络去回答一个问题:前一帧画面和后一帧画面之间的视觉过渡,代表了什么样的物理运动?
随着模型疯狂吞下这千万段路测视频,一种被称为“潜在动作”的特征表示开始在隐藏层中自然凝聚。这就像一个新手司机,在不需要被告知精确坐标的情况下,看多了路况变化,心底自然就对“左转”、“减速直行”、“等红灯”这些动态变化的视觉模式有了概念。
把物理世界的位移,压缩进50维的神秘空间
当预训练告一段落后,研究人员给第一阶段的成果做了一次可视化体检。他们把模型自监督学到的“潜在动作”投影到了二维空间中,结果令人惊喜。
图表清晰地展示出,在没有任何外界标签指引的前提下,潜在动作空间自己长出了极其整齐的运动结构。相似的驾驶行为(比如同样是向右侧变道、同样是遇到障碍物刹车减速)在特征图谱上高度聚拢。这意味着,模型并非死记硬背画面的像素明暗,而是真正提取到了具有几何逻辑的物理先验。
这里还有一个非常关键且违背直觉的发现:表示空间并不是设计得越宽、维度越高就越好。LA-Pose 的实验表明,把特征瓶颈卡在 50 维这个相对窄小的阈值上,反而能给后续的相机位姿估计带来最佳精度。如果维度过高,模型很容易偷偷夹带私货——把背景里的树叶反射、天上的云朵飘动等杂质视觉外观一起打包存下来;而被迫压缩到 50 维时,模型只能丢车保帅,留下最具普适性的物理运动框架。
第二阶段:极少标注,直接敲碎“跨数据集”的泛化魔咒
完成了第一阶段的潜行动作预训练后,接下来的微调工作就变得异常从容。研究者将第一阶段沉淀出来的核心运动编码器直接“冻结”,在它头顶上组装了一个极轻量的位姿预测分支。此时,只需要拿极少量的精密3D标注数据进行轻微拨弄,这个预测头就能迅速开窍,把之前领悟到的模糊运动感转化为具体精确的平移向量、旋转矩阵、甚至是相机的视场角和几何尺度。
在自动驾驶学术界公认的高难度数据集 Waymo 和 PandaSet 上,LA-Pose 展现出了极佳的性价比。其实测出来的位姿估算精度,比目前主流的前馈式同类模型高出 10% 以上。而达到这一水准所消耗的昂贵3D真值标注,整整比竞争对手少了几个数量级。
对于产业界来说,实验室里的高精度往往只是花架子,模型拉出去能不能在没见过的路上跑才是硬指标。在完全没有参与过任何训练的 PandaSet 盲测场景中,LA-Pose 的指标硬生生压过了基线模型。这种跨数据集的强悍泛化力,才是这套自监督打法最恐怖的地方。面对下雨天的德国高速出口、拥堵泥泞的环岛、亦或是缺少特征参考的乡村窄路,预训练模型的抗干扰能力被体现得淋漓尽致。
倒车退化与长尾挑战:新路线同样有硬骨头要啃
即便取得了令人瞩目的突破,Wayve 也坦率地指出了这一方案目前暴露出的短板。在遇到倒车这类反常规的运动时,LA-Pose 的定位精度会产生一定程度的退化。这背后暴露了自监督预训练的通病:数据偏置(Data Bias)。在真实世界累积的1000万视频中,绝大多数车辆都在前行或切车道,倒车占的比例微乎其微,导致模型在这一特殊“潜在动作”上的训练不够扎实。
针对这个硬伤,Wayve 给出的下一步解法也非常粗暴且务实:继续拓宽预训练的边界。他们不准备只局限在规整的车载摄像头视频里,而是打算把机器人手持录像、乃至其他动态移动设备采集的素材通通纳入池中。只要物体的物理运动维度够广,自监督的潜力就远远没有摸到天花板。
LA-Pose 给自动驾驶以及更广泛的具身智能(Embodied AI)行业送来了一个足够清晰的信号:别总死盯着如何去生产更贵的3D标注。真实世界里川流不息的每一辆车、拍下的每一帧运动画面,其本身就是大自然恩赐的完美监督信号。而如何巧妙地利用这些“白嫖”视频,将是下一阶段空间智能模型竞速的关键分水岭。