只用双人数据训练,就能生成七人舞蹈动画!中科院计算所与上交大CVPR 2026新作颠覆多人物视频生成

导语:CVPR 2026 论文 MultiAnimate 打破多人物动画生成瓶颈,用双人舞蹈视频训练出的模型竟能驱动七人齐舞,身份保持与空间关系处理能力惊艳学界。

从单人到多人:动画生成的核心挑战

近年来,姿态驱动的人物图像动画技术取得了长足进步,模型能够根据一张人物图像和一组动作姿态序列,生成逼真的连续视频。然而这些方法大多局限于单人物场景,一旦画面中出现多人互动,生成难度便急剧上升。在多人物动画生成中,模型不仅要保持每个人的外观稳定,还必须正确建立人物与动作的对应关系,并处理好人物之间的空间交互。如果无法持续区分不同个体,生成结果就极易出现身份混淆、动作错位或空间关系不合理等问题——例如两个人的衣服突然互换,或手臂位置出现异常。

针对这一关键瓶颈,中国科学院计算技术研究所与上海交通大学的研究团队提出了一种全新的多人物动画生成框架 MultiAnimate,相关工作已被 CVPR 2026 接收。该框架通过引入人物身份标识机制和基于人物掩码的空间关系建模,使生成模型能够在复杂互动中准确区分不同人物,并保持外观与动作的高度一致。更令人惊讶的是,MultiAnimate 在训练阶段仅使用双人数据,却在推理时能够支持三人甚至多达七人的动画生成,展现出极强的扩展能力。

MultiAnimate 如何实现可扩展的多人物生成

研究团队在数据准备上花费了大量心思,使用了三类各具特点的数据集。

  • Swing Dance 数据集:约 30 小时的双人舞蹈视频,包含 680 对舞者。视频中大量旋转、换位、遮挡等复杂互动,为模型学习多人物空间关系提供了理想训练材料。
  • Gen-dataset:利用视频生成模型 Wan2.2 自动生成的 2079 个视频片段(每段约 5 秒),涵盖两人或三人场景、不同背景与动作组合,主要用于增加场景多样性和模型泛化能力。
  • 社交媒体舞蹈视频(TikTok):包含三至七人同时跳舞的复杂场景,完全不参与训练,仅用于测试模型在更多人物下的表现。

在预处理阶段,研究人员提取了两个关键信息:

  • 姿态骨架:通过人体姿态检测模型获取人物的骨架序列,作为驱动动作的引导信号。
  • 人物追踪掩码:利用视频分割方法,为每一帧中每个人物生成精确的像素级掩码,明确标注哪些像素属于人物 A、哪些属于人物 B。这一设计是模型区分不同个体的基础。

模型训练分为两个阶段。第一阶段在 Swing Dance 数据集上训练约 40 个 epoch(≈7000 步),使用两张 A100 GPU,batch size 为 1,让模型充分理解双人互动规律。此时模型即能支持最多三人动画。第二阶段进一步引入 Gen-dataset,训练约 3 个 epoch(≈2400 步),以增强对多样化环境的适应力。此外,团队还训练了一个扩展版本,通过优化训练策略,让模型在仅使用双人数据的情况下学会区分更多人物,最终支持七人动画。

实验效果:全面超越现有方法

在 Swing Dance 数据集上,MultiAnimate 与其他前沿方法进行了严格对比,包括 UniAnimate-DiT、MimicMotion、DisPose 和 VACE。结果显示,MultiAnimate 生成的视频在视觉真实感、动作与姿态的一致性、帧间连续性以及人物身份稳定性上均明显更优。

其他方法在复杂交互中频现问题:当两人旋转或靠近时,MimicMotion 和 DisPose 可能在生成初期就出现身份混乱,如衣服颜色突变或角色互换;UniAnimate-DiT 和 VACE 在简单动作时表现尚可,但在复杂互动后仍会产生身份交换和遮挡错误。相反,MultiAnimate 不仅在整个视频中完好保持个体外观,还能正确处理人物间的遮挡与空间关系,可视化对比效果显著。

在 Gen-dataset 上,尽管模型未专门针对该数据集训练,仍能生成质量较高的视频,动作控制准确、人物外观一致、时间连贯性好。不过,在更复杂的场景中某些感知指标的提升幅度有所收窄,表明模型在极端环境下的表现仍有优化空间。

泛化能力测试中,研究人员用 TikTok 的三人、四人甚至七人舞蹈视频进行推理。模型不仅成功生成多人动画,且能正确区分所有人物、保持身份一致,空间关系处理合理。这证明训练人数与生成人数之间并非强绑定,MultiAnimate 可以扩展到远多于训练人数的场景。

关键模块的消融验证

研究团队进一步通过消融实验确认了各核心设计的有效性。

  • 人物掩码驱动机制(Mask-driven):如果移除该设计,模型在生成时立即出现人物身份混乱和空间错误。掩码为模型提供了明确的人物位置线索,是处理多人交互的基石。
  • 身份标识模块(Identifier Assigner 和 Identifier Adapter):这两个模块为每个人物分配并维持唯一的身份标识。去除后,多人物场景中身份交换和动作混乱现象大幅增加。实验证明,该模块能显著提升多人物动画的稳定性。

研究的价值与启示

MultiAnimate 的提出,从三个方面推动了多人物视频生成领域的进展。

  • 破解多人物生成难题:传统方法聚焦单人物,面对多人互动时表现不佳。MultiAnimate 通过身份标识和掩码建模,首次让模型能在动态过程中持续区分个体、维持空间关系,大幅提升了多人物动画的稳定性和准确性。
  • 强大的扩展能力:模型训练仅需双人数据,即可泛化到三人、甚至七人场景,无需为不同人数重新收集数据和训练,突破了训练数据量的限制。
  • 高效的数据利用:多人物互动数据获取成本高昂,而该研究证明,少量双人视频就能训练出支持多人动画的模型,大大降低了应用门槛,具有重要的实用价值。

背后的科研力量

论文的通讯作者安竹林,现任中国科学院计算技术研究所副研究员、博士生导师,长期深耕人工智能与计算机视觉,研究方向包括神经网络加速、视觉生成与理解。他与团队在模型效率与视觉任务上成果丰硕,多项研究推动了深度学习在实际场景中的应用。

另一位通讯作者刘松华,上海交通大学人工智能学院助理教授,博士毕业于新加坡国立大学,主攻视觉生成、数据蒸馏、模型适配等。他在图像生成、风格迁移等方面发表了一系列高水平论文,相关方法在艺术创作与视觉内容生成领域颇具影响。

参考链接:
安竹林:https://oldoc.github.io/
刘松华:https://huage001.github.io/

© 版权声明

相关文章