仅凭初始与目标姿态,PAM生成高保真手物交互视频!智源清华新作入选CVPR 2026
导语:CVPR 2026收录的PAM框架,首次实现仅凭初始、目标姿态与无纹理物体几何,生成逼真手物交互视频,并直接赋能下游任务,显著减少对真实数据的依赖。
打破数据壁垒:手物交互生成的全新里程碑
手物交互(HOI)的重建与合成,正迅速成为具身智能、增强现实(AR)和虚拟现实(VR)领域的核心基石。无论是训练机器人灵巧操作,还是打造沉浸式数字体验,都需要大量带有精细标注的真实交互序列。然而,获取这类数据的成本极高,需要耗费大量人力物力进行动作捕捉与标注,严重阻碍了技术的可扩展性。
为此,北京大学、清华大学、北京智源人工智能研究院(BAAI)、上海交通大学及东方理工大学的研究团队,联合提出了一个突破性的统一引擎——PAM(Pose-Appearance-Motion)。该工作已被计算机视觉顶级会议CVPR 2026接收。PAM首次实现了仅需给定初始手部姿态、目标手部姿态以及不含外观的物体几何形状,就能够直接生成一段逼真、连贯的手物交互视频。它颠覆了传统方法依赖完整姿态序列或真实第一帧的限制,为从仿真到真实(Sim-to-Real)的数据生成管线扫清了关键障碍。
现有方案的三大痛点
随着扩散模型的崛起,生成式AI在HOI视频合成上展现出巨大潜力。然而,目前主流方法普遍存在下述缺陷:
- 纯姿态合成:仅预测手部MANO模型的运动轨迹,不生成任何像素级外观,实用价值有限。
- 单图外观生成:根据掩码或二维提示生成静态外观,完全缺失时间维度的动态连贯性。
- 视频运动生成:虽能生成视频,但必须依赖完整的姿态序列以及真实的初始帧作为输入。在真实应用中,我们往往只有仿真器给出的手部姿态,却无从获得对应的真实图像第一帧,使这类方法难以实际部署用于Sim-to-Real迁移。
这些痛点指向一个明确的诉求:急需一个能够统一融合姿态、外观与运动的生成引擎。PAM的提出,正是为了满足这一需求。
PAM:三阶段解耦架构详解
PAM的核心思想是将复杂的HOI视频生成任务分解为三个相互衔接的阶段:姿态生成(Pose)、外观生成(Appearance)和运动生成(Motion)。给定初始MANO手部姿态、物体网格、物体初始位姿以及目标手部姿态,PAM会逐步合成最终的RGB视频序列。
第一阶段:姿态生成
本阶段旨在插值出物理合理的中间运动轨迹。采用预训练的姿态生成模型(如GraspXL),接收初始与目标姿态作为输入,输出时间连续的手部和物体运动序列。这保证了后续视觉渲染具有坚实的几何与物理基础。
第二阶段:外观生成
为弥合仿真器渲染结果与真实视频之间的视觉鸿沟,PAM利用可控图像扩散模型Flux来生成视频的第一帧。仅靠深度图或语义掩码,难以精确刻画手部的高自由度细节。因此,PAM融合了三种互补的条件引导:
- 深度图:确保全局几何一致性;
- 语义掩码:维持实例级别的语义划分;
- 手部关键点映射:提供精确的骨骼拓扑,保证手势细节的真实性。
这些条件图通过VAE编码为潜在表示,在通道维度上拼接后,注入到ControlNet分支的DiT模块中,其注入方式通过零卷积层实现平滑的特征融合。
第三阶段:运动生成
在获得第一帧后,模型用第一阶段生成的姿态序列逐帧渲染出深度、语义和关键点图。然后利用预训练的视频VAE将这些空间条件编码为时空潜在张量。PAM采用基于CogVideoX的可控视频扩散模型生成最终视频。该模型通过复制DiT模块的方式注入多模态控制特征,并在训练时以一定概率随机掩码每种条件,防止对单一模态的过拟合,提高模型泛化性。
全面超越现有SOTA
团队在DexYCB(单手交互)和OAKINK2(双手复杂交互)两个基准上进行了严格评估,对比方法包括ManiVideo、InterDyn、CosHand等先进模型。
- DexYCB数据集:PAM的FVD(视频时空连贯性指标,越低越好)达到29.13,大幅优于InterDyn的38.83。手部姿态误差MPJPE仅为19.37 mm,远低于CosHand的30.05 mm。结构相似性(SSIM)和运动保真度(MF)也均为最优。
- OAKINK2数据集:在更具挑战的双手中,PAM将FVD从68.76降至46.31,MPJPE从14.49 mm降至7.01 mm。
- 高分辨率输出:当其他方法仅能生成256×256或256×384的模糊视频时,PAM可稳定生成长宽达480×720的高保真画面。
相较于仅用手部掩码的CosHand等方法,PAM凭借多模态条件与时间注意力机制,消除了手部畸变与帧间闪烁,保证了流畅的几何运动。
消融实验:多模态控制缺一不可
消融研究证实,“深度图+语义掩码+手部关键点”的三合一组合是PAM成功的关键。移除任一模态均会导致生成质量下降:仅用关键点会使整体外观模糊,仅用语义或深度图则易引发手部姿态错位。PAM巧妙融合了全局场景理解与局部手部细节,既保证了背景与前景的视觉保真度,又消除了几何误差。
Sim-to-Real数据增强:缓解真实数据饥渴
PAM的真正价值在于其强大的Sim-to-Real迁移能力。仅仅给定初始与终止姿态,它就能利用GraspXL的运动先验和扩散模型的外观建模,合成出主体、背景多样化的逼真视频,为下游任务提供源源不断的训练数据。
研究人员将PAM生成的3,400个视频(共20.7万帧)作为增强数据,用于训练手部姿态估计模型SimpleHand。实验表明,仅使用50%的真实数据加上PAM合成的样本,模型性能就足以与使用100%真实数据的基线相媲美。这有力地证明了合成数据能够有效弥补真实数据量的不足,极大降低数据采集成本。
总结
PAM提出了创新的Pose-Appearance-Motion解耦架构,成功绕开了对真实第一帧和完整姿态序列的依赖,实现了从极简输入到高保真HOI视频的跨越。其卓越的生成质量、精准的几何还原以及在下游任务中的显著增益,为具身智能领域的生成式模型研究开辟了新的道路,有望加速机器人操作、VR交互等应用的发展。