CVPR 2026观察:当AI学会“记忆”道路、“操作”游戏、“组队”协作
导语:CVPR 2026 一系列研究揭示了 AI 从“看见”到“行动”的关键跨越:自动驾驶学会记忆道路、游戏智能体从视频中学习操作、多智能体实现任意规模协作。
过去,视觉模型更多是在回答“看见了什么”,但当 AI 进入自动驾驶、游戏、机器人和多智能体协作场景时,问题已经不只是识别环境,而是“看见之后如何行动”。
一辆自动驾驶汽车不能只知道前方有车,还要判断如何避让、如何规划路线,甚至要在遮挡、夜晚和复杂天气中借助外部信息补足感知;一个游戏智能体不能只识别画面里的角色、障碍和敌人,还要把连续观察转化成具体操作;多个机器人或虚拟人也不能只是各自执行动作,而要根据队友位置、物体形状、任务目标和团队规模动态配合。
这种变化在 CVPR 2026 的相关研究中变得更加清晰:自动驾驶方向不再只关注单一感知模块,而是开始围绕可控场景生成、真实感仿真、端到端驾驶对齐和空间检索增强展开;智能体方向也不再停留在“看见运动”,而是进一步探索如何从视频追踪走向动作学习,如何从互联网规模的玩家视频中恢复操作监督;多智能体方向则把问题推进到更复杂的团队行为,包括任意队伍规模下的人形协作,以及离线数据条件下的多目标协作学习。
这些研究看似分布在自动驾驶、游戏智能体和多人协作等不同任务里,但背后其实都在推动同一条能力链条:让模型从环境感知走向行动决策。它们关心的不只是输入图像是否被正确理解,而是场景能否被构造,动作能否被学习,策略能否在闭环中稳定执行,多个主体能否在同一任务中形成配合。
从可控场景生成到空间记忆增强
自动驾驶研究正在从“让模型看懂当前画面”,进一步走向“让模型能够构造、编辑和利用更复杂的驾驶世界”。在仿真与训练中,一个关键问题是:如何生成足够真实、可控且多样的驾驶场景,尤其是那些真实道路中少见但对安全至关重要的危险交互、罕见轨迹和复杂交通情况。
HorizonForge:任意轨迹与车辆编辑驾驶场景
由 NEC 美国研究院、石溪大学和加州大学圣地亚哥分校共同提出的《HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles》,研究的是自动驾驶场景中的可控视频生成与编辑问题,即如何在已有驾驶视频中精确修改车辆轨迹、插入新车辆,或改变自车与其他交通参与者的运动方式,同时保持画面的真实感、空间一致性和时间连续性。现有方法往往难以同时做到高真实感和精确控制:要么编辑能力有限,要么生成结果容易出现结构不稳定、时序不连贯的问题。
HorizonForge 的核心思路是先把驾驶场景重建成可编辑的 Gaussian Splats 和 Meshes,再在这个 3D 表示上进行精细操作。系统可以直接修改车辆轨迹、调整场景几何,或根据语言指令插入新车辆;编辑后的结果再通过 noise-aware video diffusion 渲染出来,用扩散模型补足真实感,并保证空间和时间一致性。相比每条轨迹都要重新优化的方法,HorizonForge 可以在一次前向推理中生成多种场景变化,更适合大规模自动驾驶仿真。
其亮点在于,把 3D 可编辑表示和视频扩散生成结合起来:前者负责轨迹和车辆控制,后者负责最终视频的自然性和连贯性。论文还提出 HorizonSuite 评测基准,覆盖自车和交通参与者两个层面的编辑任务。实验中,Gaussian-Mesh 表示相比其他 3D 表示能带来更高保真度,最终 HorizonForge 相比第二名方法实现了 83.4% 的用户偏好提升和 25.19% 的 FID 改进。这篇论文将自动驾驶场景生成推进到“可精确编辑轨迹、车辆和 3D 场景结构的可控仿真”阶段,为感知、预测和规划模型提供更可控、更可扩展的训练与测试环境。
DiffusionHarmonizer:让仿真画面更真实
由英伟达、多伦多大学、康奈尔大学和以色列理工学院合作完成的《DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer》,研究的是自动驾驶和机器人仿真中的真实感增强问题。神经重建方法虽能从真实数据恢复场景,但在新视角渲染、稀疏视角外推或插入动态物体时,常出现几何伪影、光照不一致、阴影缺失等问题。
DiffusionHarmonizer 的核心思路是把神经重建渲染出的不完美画面,在线增强成更真实、更连贯的仿真视频帧。它将预训练的多步图像扩散模型改造成 single-step temporally-conditioned enhancer,只需一步推理就能增强当前帧,同时利用前几帧作为时间上下文,保证在线仿真的时间稳定性。
其亮点在于,既保留扩散模型的真实感生成能力,又尽量满足在线仿真的效率要求。作者还设计了专门的数据构建流程,合成外观协调、伪影修复、重光照、阴影生成等数据,让模型学会处理各类不真实问题。这项工作将神经重建仿真推进到“能生成更接近真实世界的在线仿真画面”,让基于真实数据重建的仿真环境更可信、更稳定,也更具训练价值。
LEAD:缩小端到端驾驶中的专家-学生不对称
由德国图宾根大学及图宾根人工智能中心、英伟达研究院等合作完成的《LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Driving》,聚焦端到端自动驾驶中的模仿学习问题。虽然仿真器可以生成大量驾驶数据,但用专家轨迹训练出的学生模型在闭环驾驶时仍容易不稳定,核心原因在于专家与学生之间存在明显的信息不对称——专家往往拥有更全面的“上帝视角”,而学生模型只能依赖车载传感器和有限导航信息。
LEAD 系统性缩小 learner-expert asymmetry:将差距分为 state alignment(专家信息与学生的可见信息不一致)和 intent alignment(学生只拿到一个模糊的目标点)。论文通过修改专家生成方式、学生输入、导航目标表达和训练数据监督,让学生学到的驾驶策略更接近自身真实可执行的行为。训练出的 TransFuser v6 在多个 CARLA 闭环 benchmark 上取得新最好结果,例如 Bench2Drive 上达到 95 DS,并在 Longest6 v2 等场景超过以往方法两倍以上。该研究还将感知监督整合进 sim-to-real 流程,在 NAVSIM 和 Waymo 数据集上带来稳定提升,说明这种对齐思路也有助于真实世界端到端驾驶泛化。
空间检索增强自动驾驶:给模型装上“空间记忆”
由复旦大学可信具身智能研究院、上海交通大学等共同提出的《Spatial Retrieval Augmented Autonomous Driving》,给自动驾驶模型引入了类似人类的“空间记忆”能力。现有系统主要依赖实时传感器,但受限于当前视野,一旦遇到遮挡、夜晚或雨天便可能看不清道路结构。论文提出 spatial retrieval 范式:根据车辆当前位置检索离线地理图像(卫星图、街景图等),并将其作为额外输入提供给自动驾驶模型。
该信息可以从离线地图缓存或公开 API 获得,属于一种可插拔的外部空间先验。论文扩展 nuScenes 数据集,通过 Google Maps API 生成 nuScenes-Geography 数据,并设计了可插拔的 Spatial Retrieval Adapter 和 Reliability Estimation 机制,在多任务中验证效果。实验显示,空间检索在生成式世界模型中降低 FVD 和 FID,在在线地图构建中恢复被遮挡车道线,在占用预测中提升静态类别预测,在端到端规划中将夜间复杂场景碰撞率从 0.55% 降至 0.48%。该工作为自动驾驶提供了一种轻量级的环境感知增强方案。
从看见运动到学会行动
CoWTracker:用变形代替相关,高效追踪任意点
牛津大学 VGG 组与 Meta AI 提出的《CoWTracker: Tracking by Warping instead of Correlation》,研究视频中的密集点追踪。传统方法依赖 cost volume 做跨帧特征匹配,计算复杂度随分辨率平方增长,很难扩展到高分辨率长视频。CoWTracker 用 warping 替代 feature correlation:先维护每个点当前位置的估计,再根据估计将目标帧特征反向 warp 到查询帧附近,由 spatio-temporal transformer 联合更新轨迹、可见性和置信度。
这种方法使密集点追踪更简单高效,且能处理长距离运动、大视角变化和遮挡。CoWTracker 在 TAP-Vid 和 RoboTAP 等 benchmark 上表现突出,平均 Mean AJ 71.3,高于 CoTracker 3;更令人惊讶的是,同一模型不经专门光流训练,也能在 Sintel、KITTI 等光流 benchmark 上取得有竞争力的结果(EPE 0.78/1.04)。这篇论文将密集点追踪从昂贵相关匹配推进到基于迭代 warping 和时空推理的统一框架,并证明 dense tracking 与 optical flow 有机会用同一架构处理。
NitroGen:从游戏视频中学习通用操作基础模型
英伟达、斯坦福大学等联合推出的《NitroGen: An Open Foundation Model for Generalist Gaming Agents》,旨在构建一个通用游戏智能体基础模型,能够根据画面观察直接输出手柄动作,适用于千余款游戏。其核心创新在于利用公开游戏视频中显示的手柄 overlay 自动恢复玩家操作:定位并解析画面角落的虚拟摇杆和按键,将海量互联网视频转化为“视频-动作”数据集,共计约 4 万小时覆盖 1000+ 游戏。
基于此数据训练的 vision-action transformer,在 10 款商业游戏中的 30 个任务上展现出较强的泛化能力,覆盖战斗、导航、平台跳跃等。使用 NitroGen 预训练权重微调,相比从零训练,任务成功率最高可相对提升 52%。作者开源了数据集、评测套件和模型权重。NitroGen 为具身智能开辟了一条通过互联网视频恢复动作监督的新路径,让模型从大量人类玩家行为中学习跨环境、跨任务的操作能力。
从单体控制到团队行为学习
TeamHOI:任意规模的人形智能体协作搬运
Garena、Sea AI Lab 与新加坡国立大学提出的《TeamHOI: Learning a Unified Policy for Cooperative Human-Object Interactions with Any Team Size》,解决多个人形智能体协作搬运物体的难题。难点在于:策略往往只能适配固定人数,且高质量多人协作动作数据稀缺。
TeamHOI 训练一个统一的去中心化策略,基于 Transformer 将队友状态表示为 teammate tokens,使策略可适配 2 到 8 个甚至更多未见的团队规模。同时采用 masked Adversarial Motion Prior,在保持自然动作的同时,通过遮罩放任交互部位由任务奖励引导,从而从单人参考动作数据衍生出多样的多人协作行为。实验显示,TeamHOI 在 2/4/8 人搬运方形、长方形或圆形桌子的成功率分别为 99.1%、99.2% 和 97.5%,5 倍重载下 8 人仍达 81.1%,显著优于仅适配固定人数的基线方法。该工作将多人协作从“固定人数、固定策略”推进到“任意团队规模下的统一协作策略”。
MangoBench:离线多智能体目标条件协作基准
中山大学与香港理工大学提出的《MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learning》,关注多个智能体在无法在线试错、仅使用离线数据的情况下,如何根据目标进行协作。现有方法多依赖人工设计奖励,难以泛化到新目标。MangoBench 是首个全协作、多目标的 goal-conditioned offline MARL 基准,覆盖 3 个环境、4 类智能体和 47 个任务,包括联合控制运动与双臂操作,支持完全去中心化训练与 CTDE 两种范式,为多智能体离线协作研究提供了系统评测平台。
综合来看,CVPR 2026 的这些研究共同勾勒出一条清晰的趋势:AI 正在从“理解世界”走向“参与世界”。无论是自动驾驶中更可控的场景生成、更真实的仿真增强、更本征的模仿学习对齐,还是引入空间记忆以弥补感知局限;无论是从视频追踪走向动作学习,还是从单体控制走向任意规模的团队协作——模型不再只是识别“是什么”,而是开始学习“怎么做”,甚至“如何配合”。这或许标志着视觉与具身智能研究的一个新阶段:让模型真正成为能在复杂环境中判断、行动、协作的自主参与者。