从GPT-4o到原生音画视频:九大顶尖研究机构联合拆解音视频大模型演进图谱
导语:详解九大机构联合发布的音视频大模型系统综述,揭开多模态AI演进的技术路线与产业未来。
如果说过去一年里大语言模型重塑了我们对“自然语言理解”的认知,那么在当下的前沿探索中,AI 正在撕下单一模态的标签。GPT-4o 可以看着手机屏幕在毫秒级内与你欢快交谈,Meta MovieGen、Veo-3 乃至 Seedance 2.0 把原生音轨直接揉进了视频实时生成的底层链路,而在具身智能领域,OpenVLA 已经让机器人摆脱了纯视觉局限,转向用耳朵“听音辨物”并作出敏捷反馈。
这一切动态都指向了一个明确的行业坐标:音视频智能(Audio-Visual Intelligence, AVI)已经从曾经挂载在视觉模型旁侧的边缘组件,逐步升级为全模态底层架构的核心骨干。
然而,相较于纯文本或纯视觉领域的繁荣,音视频智能技术在学术界和工业界长期处于高度碎片化的状态。数字人搞数字人的嘴形同步,视频生成玩视频生成的配音,机器人导航走机器人的声学建图,大家都在各用各的范式,指标与数据集也各说各话。这让许多意图涉足这一交叉地带的研发团队感到无所适从。
为了理清这一混沌生态,新加坡国立大学(NUS)联合牛津大学、多伦多大学、微软研究院等全球 9 家顶尖学术机构,推出了这份极具分量的音视频大模型系统综述。作者用一张跨越十年的技术进化树,将散落在各个子领域的拼图重组成一个结构清晰的宏大版图。

打破割裂,首份多机构联合构建的AVI通盘地图
回顾前几年的工程尝试,整个方向的学术地图确实过于分散。声源定位、唇语识别(Lip Reading)、视频配乐(V2A)、音频驱动视频(A2V)、空间音频推理、音视频问答(AVQA)……每个细分场景在过去都像是独立的孤岛。这篇由多校联合发表的重量级报告,其核心立意在于重新确立音视频智能在通用大模型时代下的主体性地位。它不是要将这些场景视为零散的应用,而是呼吁行业将其看作一门有系统性演进脉络的底层能力。
论文将过往十年中繁杂的科研力量抽丝剥茧,总结出三条并行的关键探索路径:理解世界(Understanding the World)、创造世界(Creating the World)以及与世界交互(Interacting with the World)。以此为框架,报告提供了统一的分类学体系(Taxonomy)、基础技术拆解方案,并给出了指向未来三年的核心研究指引。
十年技术进化树:从“对得上”到“听看说动一体”
在这篇综述的技术图谱中,最惹人注目的,当属这幅贯穿 2016 至 2026 年的音视频智能十年进化树:

作者把这段长达十年的跋涉划分为四个极富代际特征的发展维度:
第一阶段(2016-2018):音画对齐(AV Alignment)
在起步阶段,学界的注意力主要放在如何让画面与声音“对准”这类基础约束上。L3-Net、Wav2Lip 和 Audio2Head 等经典项目构成了这一时期的骨干。此时,大多数对话系统也主要依赖粗糙的级联式组合:先通过 ASR(语音识别)把语音转为文字,交给 LLM 处理后再用 TTS(语音合成)读出来。这一阶段面临的最大门槛就是“对得上”。
第二阶段(2019-2022):尺度化表征与音频原生大模型(Scaled Representations)
随着大规模对比学习的理念席卷多模态领域,XDC、AVID 和 VATT 等工作开始走向历史前台。同时,以 AudioLDM 和 MusicGen 为代表的单模态生成式算法迎来突破性进展,SpeechGPT 和 Qwen-Audio 的问世把音频原生大模型带到了新的高度,奠定了后续融合多模态技术的研究走向。
第三阶段(2023-2024):音视频创造大爆发(AV Creation)
在这一节点下,将不同模态进行双向转换的能力(比如“以视生音”或“以音控视”)真正占领了产业核心。Diff-Foley、FoleyCrafter 以及 MMAudio 等优秀的模型不仅能为没有声音的画面配上极其逼真的物理拟音,同时也使得多模态控制器系统的生态日益繁荣。
第四阶段(2024-2026):全模态融合与具身协作(Omni / VLA)
这便是我们当前所处的新世代。得益于 JavisDiT、MovieGen、GPT-4o 以及 OpenVLA 等前沿研究的支撑,整个行业真正开始告别级联系统,走向全模态融合的 Backbone 模型时代。与此同时,音画同步的视频生成、毫秒级实时流式音视频对话,以及面向物理世界的机器人动态操纵正爆发出蓬勃的行业生命力。
但在欢欣之余,报告中也特别强调:从第一代到第四代,音画同步差、时间一致性断档、可控性欠佳、评测体系混乱、实时延迟较高以及安全治理与版权合规合规难等六大瓶颈,始终在不同的技术维度反复出现。它们难以仅靠“把参数量做大”来粗暴解决,只能通过架构层面的深刻变革去实现自我进化。
解构分类学:聚焦三大主线任务
这篇文献的核心产出,在于将音视频智能的底层任务逻辑重新提炼并重构为三条主线:

1. 理解世界(Perception/感知层面)
不仅包含了经典的音视频语音识别(AV-ASR)、活跃说话人检测(ASD)、声源分离与定位,更加强调基于多模态大模型对长视频进行深度因果推理与时空事件检索的能力。它不仅要听清什么人在说话,更要感知声音背后的物理空间和运动状态。

2. 创造世界(Generation/生成层面)
涉及跨模态合成与编辑。传统方法的痛点在于音和画常常在生成后出现逻辑上的割裂。而如今以 MovieGen 和 HappyHorse 为代表的原生多模态联合生成思路,则能够从文本触发,真正做到在生成高清画面的同时,渲染出符合物理力学逻辑、声学反馈合理的音轨。不过,跨长周期场景的语义一致性、局部的精细音画控制与后期编辑,依然是亟待跨越的难关。
3. 与世界交互(Interaction/交互与行动)
这里的交互指的是闭环响应,包括像 GPT-4o 般超低延迟的实时音视频交谈,以及机器人在空间方位内的行为控制。以 SoundSpaces 和 OpenVLA 这一类工作为坐标,机器需要在接受声光变化的同时建立运动行为的闭环——即“感知-思考-行动-反馈”的动态链条。这正是端到端 omni 模型被视作未来具身智能关键拼图的重要逻辑基础。
技术底座拆解:大模型架构选型指南
探讨完“做什么”,技术解构一章深入分析了“怎么做”。对工程落地而言,这无异于一张架构选型图表,全面厘清了音视频大模型的技术栈设计:
- 表征与代币化(Representation & Tokenization):在大语言模型的主板下,如何把动辄数兆的高维音视频波形和图像序列压缩成极高表征密度的离散 Token,如何降低对齐偏差。这影响了整个模型底层的计算效率。
- 多范式生成逻辑(Generation Paradigms):系统评估了自回归(AR)、扩散模型(Diffusion)、流匹配(Flow Matching)以及混合式架构系统在大尺度创作场景下的极限,并对它们的推理性能和可控度进行了清晰对标。
- 骨干网络结构(Backbone Architectures):展现了工业里搭建此类模型的几种代表性范式:基于单一视觉-音频 Encoder 串行注入 LLM 的分立方设计,或者采用统一自注意力计算的集成式多模态方案。
探索前沿:重新定义音视频智能的黄金时代
如何前行?报告在这部分的末尾跳出了传统的技术路径依赖,而是站在结构性的视角上,划定了六条引领未来的关键探索航道:
- 因果声源接地(Causal Grounding):在复杂混响、遮挡及旁白干扰等多声源混合语境中,实现微秒级物理对齐与因果追溯。
- 物理世界模型(World Model with AV):让 AI 学会同时从物体材质、重力、空间几何和环境声响等复合常识中抽取规律,达成空间音频的高度推演。
- 长程音视频记忆(AV Context Memory):摆脱靠无情堆叠算力拉长上下文的做法,转向建立带情感机制、具有可变深细度的流式结构化情景记忆。
- 因果可控编辑:支持对生成素材的运动速率、情绪极性、场景材质进行高解耦的局部操作与多轨道即时修改。
- 物理合理性评估生态(Verifier & Reward):逐步淘汰粗粝的传统代打指标,转向更倾向物理真实合理性与人机交互任务效用的综合评价矩阵。
- 交互与负责任安全防线:在实现硬性毫秒级超低推理链路的同时,重点研究深伪检测防伪、数字内容盲水印植入、敏感隐私过滤与合规。
综上所述,当前音视频大模型的市场竞争正从“概念测试”迈入“核心链路重塑”。对于致力于打造大模型底座、高保真数字人、音视频互动游戏陪伴、乃至新一代端到端具身智能设备的团队,这份综述不仅是学术界的集大成之作,更能充当研发过程中架构设计的宏观指南。在这个走向全感官协同的研究长跑中,如何用高效且符合物理规律的逻辑让机器“听其声、知其意、见其形”,正成为行业跨越前夜最为关键的终极考验。




