丢掉99%延迟!复旦团队开源Hallo-Live,音视频数字人终于跨入20帧实时流时代

导语:介绍Hallo-Live如何通过双流蒸馏将音视频数字人在双H200下跑到20帧,打破低延迟与画质同步瓶颈。

谈到文字生成视频,大家可能已经看习惯了那些光鲜亮丽的Demo。但如果把要求稍微提高一点——不仅要能生成,还要“实时交互”,事情就变得棘手起来。许多做过数字人直播或者高频交互项目的朋友应该深有体会。传统的双流扩散模型(比如Ovi)虽然能生成音画同步、画质惊艳的数字人视频,但那种几千毫秒甚至长达数分钟的计算等待,注定了它们只能活在“离线生成”的世界里。一旦试图硬生生给它“加速”,随之而来的代价往往是灾难性的:嘴型开始对不上,语调变得像上世纪的复读机,连人物脸部的精细纹理也会糊成一片。

这正是前沿AI研究里的一块硬骨头。而在2026年4月,复旦大学的一项新研究 Hallo-Live 正式公开。这项工作将异步双流扩散与人类偏好引导蒸馏结合,在两张 NVIDIA H200 GPU 的测试环境下,跑出了 20.38 FPS 的极致吞吐和仅仅 0.94 秒的端到端延迟。相比于他们自己的教师模型Ovi,吞吐暴增 16 倍,而延迟更是被无情地削去了 99.3%。

目前,该研究论文《Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation》(https://arxiv.org/abs/2604.23632)已公开,代码也已在 GitHub(https://github.com/fudan-generative-vision/Hallo-Live)开源。本项研究由复旦大学博士生的李淳誉(研究方向为视频生成扩散模型)和复旦大学硕士生的李佳烨共同担任第一作者,并由上海创智学院全时导师朱思语教授担任通讯作者。

为什么实时音视频双流生成是一座大山?

在做深入的架构拆解前,我们先建立一个共识:文本驱动的音视频生成,并不是简单地把“文本转语音(TTS)”和“语音转视频(唇形匹配)”拼接在一起。它的真正难题在于,模型需要在同一条时间轴线上,同时理解并融合包含文本语义、人像运动、声音起伏以及发音微表情的超高维计算。

以前的经典做法是,把音频和视频分成两条流,各走各的路,最后再做一个跨模态融合。虽然解决了“能不能生出来”的问题,但真想要做成能在直播间里实时对答、或者在客服终端里流式输出的系统,你会撞上两座避无可避的技术高墙:

  • 时序因果性的硬冲突:为了实现流式传输,系统一般会采用严格的块级注意力机制(Block-Causal Attention),即当前的帧只能看当前和过去的信息。然而在现实世界中,人类说话存在明显的“协同发音”现象——也就是说,你的声带还没发出声音,你的嘴唇、牙齿和舌头就已经提前开始摆出那个发音的姿势了。这就需要视频流提前“看”到一小段未来的语音信息。如果严格一刀切阻断未来信息,渲染出来的数字人就会出现严重的对不上口型、动作呆滞等问题。
  • 加速蒸馏导致的“均值化退化”:目前大模型提速往往依赖步数极少的蒸馏。但直接做普通的分布流匹配蒸馏,会因为样本生成多样性与约束不够,导致出来的视频细节退化为“最安全的平均状态”——画面变模糊、脸部没有微表情、语音语气听起来极其生硬死板。

Hallo-Live架构拆解:在异步双流中建立“预读区”

针对以上问题,Hallo-Live并没有走简单的“算力大力出奇迹”路线,而是通过极其精妙的网络结构变化和蒸馏控制,把整个框架做薄、做实时。

【99%延迟暴降降维打击】实时音视频数字人最新生成突破

研究团队将训练划分为两个主要的渐进阶段。在初期的 ODE 初始化阶段,模型被输入不同噪声层级的音视频块,并借助单模态与跨模态的块级因果 Mask 进行训练。这一步的核心目的,是让训练阶段所受的信息可见性约束,跟后续流式推理阶段完全对齐。接着,在自回归生成与少步蒸馏阶段,学生模型基于音视频的 KV Cache 进行增量式生成,同时引入音视频一致性与画面质量相关的 Reward 函数,对双流 DMD(Distribution Matching Distillation)的损失进行重新加权。

【99%延迟暴降降维打击】实时音视频数字人最新生成突破

在这套框架里,Causal Fusion Block 是双流架构的大脑。视频和音频流各自完成单模态的注意力计算,注入文本参数后,依靠跨模态的 Block-Causal Cross-Attention 整合在一起。这里就涉及到了论文的一个机制创新:未来预读注意力(Future-Expanding Attention)

既然视频帧需要提前知道未来的发音,那能不能给它开个“后门”?研究团队设计了一种非对称的跨模态注意力掩码:音频流依然只根据时间步平稳推进,但视频流在看向音频时,其键值(KV)范围会额外向前窥视一小个“look-ahead”窗口。如图所示,严格的块级注意力只能获取当前,而未来预读自注意力则为视频块提供了少量未来的音频上下文。

【99%延迟暴降降维打击】实时音视频数字人最新生成突破

这就像是给视频模型装了一个实时的临时草稿本。最关键的细节在于,这个被提前查看的未来音频块,只是一个用来指导视频生成口型的过渡版本,而不是最终放给观众听的成品语音。当下一步真正到来时,最终版本的、高质量的音频采样会彻底覆盖这个过渡块。这样既把提前张口、闭口等细微动作卡准了,又没有任何损失音频保真度的后顾之忧。

人类偏好引导:把“好不好看”直接写进损失函数

传统的多步到少步蒸馏就像是在全班默写一篇长文章,最后学生交上来的答卷能对齐大意就不错了,字体美丑和神态语气根本顾不上。Hallo-Live引入的 HP-DMD(Human-Centric Preference-Guided DMD)则改变了蒸馏方式。研究团队将“人类偏好”具象化为三个细分的评估网络:

  • VideoAlign:重点监督视频画面的美学、背景稳定性以及人物神态与文本的一致性。
  • SyncNet:像一名极度挑剔的唇语专家,专门盯防嘴型跟发音是否一纳秒都不差。
  • AudioBox:则专注于测试声音的声学质感,拦截生硬而机械的电音。

微调技术上,团队没有把这个过程做成复杂的网格强化学习策略梯度优化,因为那非常消耗算力。相反,他们利用了“奖励重加权”的思想。先将学生模型试跑出的音视频用这三大评估器进行量化打分,再通过指数加权的方式,把分数反馈回去重新修剪学生模型的目标分布。

在这种方式下,学生模型不再是生硬死板地去贴合原教师模型的整体平均分布,而是倾向于朝表现优异的样本分布做出逼近。这也是为什么Hallo-Live在大幅压缩生成步数后,依然能守住顶尖视觉质量和细腻质感的关键所在。

领跑实时生成区间,实测数据有多硬?

在真实的性能测试中,Hallo-Live所表现出来的速度优势达到了“代差”水准。

【99%延迟暴降降维打击】实时音视频数字人最新生成突破

当把Hallo-Live跟业界的LTX-2、JavisDiT、UniVerse-1等主流模型放在同一起跑线上时,其实测硬数据非常抢眼:

  • 帧率吞吐:Hallo-Live 跑出了 20.38 FPS 的流畅速度。这也是文本驱动音视频生成领域,为数不多能够跨越 20 帧实用门槛的方案。
  • 极低延迟:端到端延迟直接缩减到了 0.94 秒。在人机交互的场景下,1秒是感知临界点。可以说,Hallo-Live打破了原先交互过程中的漫长停顿。
  • 生成质量:在衡量美感与画质的 VideoAlign 综合测试中获得了 2.32 的出色分数,在 Sync-C 唇形同步指标上拿到了 4.72,极其接近甚至有些单项小优于原本厚重的离线教师模型 Ovi。

这种表现证实了架构的实用性——它是用高超的算法设计在少步下守住了质量,从而将系统从“PPT演示”推到了可部署的可用状态。这为随后数字人直播、虚拟助手甚至在云端部署的沉浸式NPC交互,清除了因网络解析与多步计算带来的卡顿折磨。

通往自然交互的更远一步

客观来看,Hallo-Live目前也有一些有待后续攻克的瓶颈,例如当前的低延迟运行环境依旧建立在两台 NVIDIA H200 的硬件配置之上。对于许多做轻量化、边缘侧部署,或者受限于运算成本的团队而言,低成本硬件的适配工作还需要进一步优化。此外,相较于天花板级别的超长视频离线渲染,Hallo-Live在声音和画面同步的高频细节方面,依然有继续提炼的空间。

但这并不妨碍我们看到这条路线背后的敏锐性:它不再追求空洞的参数量膨胀,而是真正脚踏实地,在保持流式因果约束的前提下,做到了音视频联合生成的可部署化与强交互性。随着未来模型结构的持续瘦身和消费级GPU推理生态的逐步成熟,实时互动数字人真正普及到我们生活场景的那一天,也许已经不远了。

© 版权声明

相关文章