自动驾驶也该会“回忆”:复旦上交把街景和卫星图接进车端模型
导语:复旦与上交提出空间检索增强自动驾驶,让车学会调用历史地理记忆。
车在路上跑,最怕的不是没有模型,而是模型只相信眼前这一小块画面。夜里没有路灯的路口、雨雾里的主干道、被大车遮住的车道线、结构复杂的立交匝道,都会把自动驾驶系统逼到一个尴尬位置:传感器还在工作,但它看到的世界不完整。
人类司机遇到这种情况,通常不会只盯着前挡风玻璃里的那一帧画面。我们会调动对道路的记忆:这里原来有几条车道,哪里是分叉口,人行横道大概在什么位置,前面是不是要上高架。复旦大学可信具身智能研究院与上海交通大学团队这篇 Spatial Retrieval Augmented Autonomous Driving,切入点就放在这里——给自动驾驶补上一种可检索的“空间记忆”。
论文地址:https://arxiv.org/pdf/2512.06865
不是多装一个传感器,而是让车学会查“道路旧账”
这项研究的核心思路并不复杂:车辆根据 GPS 和位姿信息,检索当前位置对应的街景图、卫星图等历史地理图像,再把这些 Geo 信息与车载相机特征融合,给模型提供一份额外的道路结构参考。
这和大模型里的检索增强有些相似。大模型不能只靠一次性上下文解决所有问题,需要在外部知识库中查找、调用长期记忆;自动驾驶也不应该永远只依赖当前相机、激光雷达或 IMU 捕捉到的瞬时信息。道路空间有一部分是稳定存在的,比如车道线、道路边界、人行道、建筑轮廓、可行驶区域,这些信息完全可以通过历史地理图像沉淀下来。
研究团队也没有把 Geo 图像吹成万能钥匙。实验结果反而把边界划得很清楚:它对静态道路结构最有用,对车辆、行人等实时动态目标帮助有限。换句话说,Geo 不是替代实时感知,而是给实时感知加一层空间先验。当摄像头看不清、看不全、看不远时,模型至少还能知道“这条路原本大概是什么样”。
哪些任务吃到了红利?静态结构最明显,动态目标很克制
研究团队把 Geo 信息接入多个自动驾驶任务,包括在线建图、占用预测、3D 目标检测、端到端规划和世界模型。结果很有意思:越依赖稳定道路结构的任务,收益越明显;越依赖当前时刻动态目标的任务,提升越小。
在线建图:MapTR、MapTRv2 提升最扎实
在线建图是这项研究里受益最直接的任务。原因很直白:它主要识别车道线、道路边界、人行横道等静态元素,而这些正是街景图和卫星图擅长补充的内容。
- MapTR 的 mAP 从 50.3 提升到 61.2。
- MapTRv2 的 mAP 从 61.5 提升到 73.4。
在低曝光、雨天和遮挡场景里,加入 Geo 后,模型能恢复更多道路细节。这个结果很符合实际驾驶经验:如果眼前车道线被水雾、阴影或者前车遮住,历史地理图像就像一张低频但稳定的参考底图,帮模型把道路结构补回来。
占用预测:可行驶区域提升更有价值
占用预测也有提升,只是幅度不如在线建图抢眼。Geo 的帮助主要集中在可行驶区域、人行道、地形等静态区域。
- FBOcc 整体 mIoU 从 39.11 提升到 39.74。
- 其中可行驶区域从 80.07 提升到 82.47。
这个提升不算夸张,但方向很关键。自动驾驶系统真正需要的,不只是“看见一个像素”,而是判断哪里能走、哪里不能走。Geo 图像对道路空间结构的补充,恰好能增强这类判断。
3D 目标检测:提升很小,原因也很现实
目标检测的结果就克制得多。BEVFormer 的 mAP 仅从 41.60 提升到 41.64。这不是方法失败,而是任务属性决定的。
3D 目标检测关心的是当前道路上的车辆、行人、骑行者。这些对象几秒钟前后都可能完全不同,而街景图、卫星图本质上是离线地理信息,可能来自几个月甚至几年前。它当然无法告诉模型此刻前方是不是突然窜出一辆电动车。研究团队在这里给出的结论很清醒:Geo 更适合做空间结构参考,不适合承担动态目标感知。
端到端规划:轨迹误差不大变,但安全性有改善
在端到端规划任务中,Geo 对轨迹误差影响不大,但对安全指标有帮助。实验显示,Night 场景下碰撞率从 0.55% 降到 0.48%。
这说明 Geo 不一定能让预测轨迹更贴近真实轨迹,却可能在夜间、雨雾、复杂路口这类低能见度环境中提供更稳定的道路参考。对实际上路系统来说,这类收益反而值得认真看。轨迹误差少一点固然好,但碰撞风险下降,含金量更高。
世界模型:减少道路漂移和场景幻觉
世界模型同样吃到了 Geo 的红利。长时间生成驾驶视频时,模型常见问题是道路开始漂、背景不一致、结构越生成越离谱。Geo 图像在这里扮演的是空间约束:未来道路应该长什么样,不完全由模型“脑补”,而是参考真实地理结构。
实验中,UVG 的 FVD 从 36.10 降到 29.97,意味着生成结果更稳定,幻觉现象也更少。自动驾驶世界模型如果要服务规划和闭环仿真,不能只追求视频好看,关键是道路结构不能乱。Geo 的价值正落在这个痛点上。
nuScenes-Geography:把地理图像接进自动驾驶数据集
为了验证这套思路,研究团队基于 nuScenes 构建了扩展数据集 nuScenes-Geography。做法是先根据 nuScenes 中的车辆位姿数据计算每一帧对应的经纬度,再通过 Google Maps API 获取当前位置的街景图和卫星图。
拿到地理图像后,团队进一步做空间对齐,让模型能同时看到两类信息:一类是车载相机拍下的当前视角,另一类是当前位置对应的历史地理视角。
- train split 中可用地理图像占 94.32%。
- val split 中可用地理图像占 92.41%。
这个覆盖率说明实验并不是挑了少数“地图刚好可用”的理想样本来做,而是大多数场景都能检索到 Geo 信息。对这类方法来说,数据覆盖率很重要。覆盖太低,研究就很难从论文走向系统。
街景图不能逐帧下载,工程上得算账
论文里有个细节很工程化,也很值得看。街景图并不是按车辆每一帧单独采集的,很多连续车载帧会对应同一个街景位置。如果每帧都下载街景裁剪图,重复数据会非常多,存储和计算成本也会被拉高。
研究团队采用了更省的办法:每个街景位置只下载一次。为了覆盖不同方向,他们在同一个街景位置下载 18 个方向的街景视角,并合成为全景图。之后系统再根据当前车载相机的方向、位置和视角参数,从全景图中重新投影出更接近当前驾驶视角的 Geo 图像。
这种做法相比逐帧下载街景裁剪图,节省了超过 70% 的存储空间,同时减少重复数据。自动驾驶研究如果只在指标表上漂亮,离部署还远;能把数据冗余、存储成本这类问题提前处理掉,才更像是面向真实系统的方案。
Geo 信息也会骗人,所以团队做了可靠性估计
把街景图和卫星图接进模型,有一个绕不开的问题:它们不一定可靠。
现实道路里,街景可能缺失,数据可能过时,GPS 可能漂移,高架和地面道路可能被混淆,道路施工也会改变环境。比如一张街景图拍摄于数月甚至数年前,当前路口已经改道、围挡、重画标线。如果模型无条件相信这张图,错误会被放大。
因此研究团队设计了可靠性估计模块 REG。它会同时考虑 Geo 图像与当前车载图像之间的视觉相似性,以及地理位置匹配程度,决定模型应该多大权重使用 Geo 信息。
为了训练这个模块,团队人工标注了 1800 个错位样本。数据统计也说明他们没有假设 Geo 永远正确:
- train split 中错位图像占 4.93%,缺失图像占 0.75%。
- val split 中错位图像占 6.88%,缺失图像占 0.71%。
消融实验进一步验证了这套设计的必要性。没有 Geo 时,静态 mIoU 为 46.66;加入 Geo 后提升到 47.86。研究团队认为,Geo 图像、位置编码和可靠性估计模块都在整体性能提升中发挥了作用。
从感知增强到仿真约束,自动驾驶多了一条路线
这篇工作的意义,不只是在某张表格上多涨了几个点。它真正有意思的地方,是把自动驾驶从“只看当前传感器”往“实时感知 + 历史空间记忆”推了一步。
过去自动驾驶研究的注意力主要放在传感器堆叠、模型结构、端到端学习、闭环评测上。复旦可信具身智能研究院与上海交大团队这次把外部地理信息引入系统,让车辆主动检索当前位置的历史道路信息。这条路并不替代高精地图,也不替代实时感知,它更像一层可更新、可检索、可估计可靠性的空间先验。
更往后看,这个方向还有不少可扩展空间。公开街景和卫星图只是开始,车队历史数据也可以成为更鲜活的空间记忆;单点检索可以扩展到附近多视角检索;世界模型生成未来场景时,也可以提前按未来轨迹调取对应地理图像,用真实道路结构压住模型幻觉。
论文作者之一贾萧松现为复旦大学可信具身智能研究院助理教授,研究方向覆盖自动驾驶、具身智能、端到端驾驶、闭环评测、世界模型、强化学习、轨迹预测与多传感器融合等。他本博毕业于上海交通大学,导师为严骏驰教授,已在 TPAMI、IJCV、RSS、CVPR、ICCV、ECCV、NeurIPS、ICLR 等会议和期刊发表论文 40 余篇,相关研究曾获得 ICCV 2021 Mair2 Workshop 最佳学生论文奖、CVPR 2023 最佳论文奖,并在 2025 年 Waymo 仿真智能体世界模型挑战赛中获得冠军。
复旦大学可信具身智能研究院则是复旦面向下一代人工智能设立的校级实体化科研机构,重点关注 AI 从数字空间走向物理世界后的安全、可靠与可控问题,研究方向包括具身基础模型、数据引擎、具身交互、本体研制和可信机制。官网:https://teai.fudan.edu.cn/
自动驾驶进入长尾场景和世界模型竞争阶段后,只靠“眼前所见”会越来越吃力。让车端模型具备可检索的空间记忆,不会解决所有问题,但它给安全冗余和道路理解补上了一个很实在的接口。