时隔一年李沐低调回归!带队攻克数字人延迟瓶颈,单片主卡跑出8路并行

导语:李沐BosonAI 实时数字人模型 Higgs Avatar v1 强势回归,实现一张照片秒变高清分身。

熟悉国内 AI 圈子的朋友,对李沐这个名字一定不陌生。这位昔日在 B 站手把手教大家读论文、拆解深度学习代码的大神,在悄然停更近一年后,终于带着他的最新创业成果回到了大众视野。

在这期最新更新的视频里,李沐向大家介绍了他做出的实时数字人分身,并与这个虚拟分身展开了一场相当流畅的视频通话。视频当中,数字人神态自然、动作贴切,连口型和语调的配合都显得十分协调,拟真度高到被李沐本人调侃为“水平吊打我自己”。而在这个体验背后站着的,正是他的创业公司 BosonAI 最新发布的首款面向实时语音智能体的面部基础模型——Higgs Avatar v1。

开局一张图,如何让数字人完成即兴表演?

传统的数字人制作往往伴随着高昂的门槛:不仅需要电影级的 3D 动作捕捉,还要经过复杂的网格重构和骨骼绑定,任何一帧画面的渲染都需要后台巨大的服务器集群苦苦支撑。更棘手的是,在脱离剧本的实际交互中,传统的生成系统很难在瞬间组织好对应的面部表情,容易导致动作出现滞后感甚至生硬的循环播放。

李沐团队发布最新模型!秒级实时数字人交互迎来技术突破

Higgs Avatar v1 带来了一种更为轻量且高效的实现路径。它最大的优势在于对生成素材的极低要求。使用者只需要提供任意一张静态的肖像照片,系统就能立刻将其转化成一个极具表现力、能够完成实时双向对话的动态角色。在这个生成逻辑中,所有的表情变化、唇形变化以及头部微动都免去了脚本的束缚,完全由实时的语音数据驱动,实现口型与音频的瞬时对齐。

  • 逐帧即兴表现: 没有预设的代码或生硬的循环动画模板,画面完全根据当下的声线起伏,一帧接一帧即时渲染。
  • 轻巧的冷启动: 哪怕手里仅仅拿到了单张静态人像,模型也能瞬生成生动的眨眼、扬眉和转头细节。

用数据说话:逼真对话底层的物理参数

人机交互领域公认的常识是,要想维持实时对话交互的自然感,音频到画面渲染的系统时间差阈值大约是 62.5 毫秒。如果这个数值被突破,画面就不可避免地会显现出塑料感与脱节感,这也是以前许多“实时视频通话”容易引人出戏的主要原因。

李沐团队发布最新模型!秒级实时数字人交互迎来技术突破

在具体的性能表现上,根据 BosonAI 团队披露的技术指标,Higgs Avatar v1 渲染生成单帧画面的延迟已经缩减到了 16 毫秒。这就把画面的生成负荷妥善控制在时间红线以内,确保每一声叹气、每一次强调都能被眼角和嘴唇的运动瞬时呈现。除速度之外,企业级部署最关心的开销成本在这次展示中也得以体现:这套渲染模型单片 H100 即可同时处理 8 路并行的实时对话,这意味着在未来的实际落地时,计算资源能被合理利用,把单次通话成本降到了实用的区间。

为什么拼凑 API 行不通,必须全栈自研?

不少开发人员可能会有疑问:如果把市面上成熟的语音识别、文本大模型、语音合成以及开源数字人模型拼接成一条流水线,能否做到类似的效果?BosonAI 官方给出了坚定的否定。

若单纯依赖分立的云端接口来“缝合”系统,在实际的多轮实时对话中会面临几个现实痛点:

  • 情感错配: 各系统模块彼此独立运行,声音引擎和视觉渲染无法做到精准的咬合,容易发生语气愤怒但面部死板的空洞情况。
  • 交互撕裂: 多套系统并行堆叠会带来极长的延迟,导致人机交流极易发生打断或空档。
  • 稳定性隐患: 在高并发的大规模流量下,复杂的底层接驳极易崩溃,容错率难以保障。

针对这一痛点,BosonAI 给出了全栈闭环的设计理念。在他们双擎驱动的版图中,Higgs Audio 专注完成音频维度的解码与生成,而 Higgs Avatar 则全盘掌管与之配合的精细面容。通过将声学建模与视觉演化在底层高度耦合,才能算无遗策地打通高品质的对话流。

多场景智能体正在走向现实

伴随着这次技术方案的亮相,BosonAI 官方也公开了几个直观的应用方向,展现了这种低延迟数字人技术在实际业务中潜在的落地可能:

  • AI 保险代理与客服: 拥有得体的商业表情和精准的解答配合,让线上业务办理不再是冷冰冰的填表。
  • 虚拟教练互动: 在用户需要学习或者遭遇情绪挫败时,给出积极、真诚的视觉反馈。
  • 经典历史重现: 让历史名宿以生动的姿态与下一代人开展面对面的无脚本讨论。

目前,Higgs Avatar v1 已经正式开启定向内测,接下来这套能力也将深度载入他们规划中那款名叫 Boson Presence 的多模态语音交互产品里。在历经一段时间的潜心打磨与积蓄之后,这位前研究大拿已经把目光锁定在更下一代的实时交互,这次数字人技术的硬核出拳,或许仅仅是个开始。

© 版权声明

相关文章