读懂音乐时间线到底有多难?复旦与字节联手打造GaMMA,多模态大模型终于学会“按秒听歌”

导语:多模态大模型能看能读,却听不懂歌里的高潮?复旦与字节推出的GaMMA模型,让AI真正学会了按秒理解音乐。

现在的多模态大模型,能写诗、能作图,甚至能像模像样地听懂人类的语音指令。但如果你给它播放一首乐曲,问它:“这首歌的高潮从第几秒开始?”或是“第 30 秒之后吉他的扫弦节奏发生了什么变化?”你得到的往往是一通胡编乱造,或者干脆是一句模棱两可的废话。

能读、能看、能听,偏偏听不懂一首歌的“时间线”,成了多模态大模型的一块顽疾。本质上是因为目前的音频模型大多是“披着音乐外衣的语言模型”,缺乏对旋律、节奏、和声等动态时序的精准建模。为了戳破这层窗户纸,复旦大学与字节跳动的研究团队联合推出了 GaMMA——一个专门为了音乐全局语义与时序动态联合建模而设计的全新多模态大模型。

在多项音乐理解评测中,GaMMA 刷新了行业纪录,在时序理解这一极难的任务上更是超越了此前业内风头正劲的 Gemini-3.0 Pro。它是如何做到的?这还得从多模态模型在音乐时间轴上的结构性尴尬说起。

双重分裂的音乐理解:时间与风格能兼顾吗?

要让大模型真正懂音乐,需要解决两类截然相反的任务:

  • 全局语义理解:这首歌是什么风格?使用了什么乐器?基调是欢快还是悲伤?这类任务侧重高层抽象,追求高压缩率,忽略局部细节。
  • 时序结构理解:从第几秒到第几秒是副歌?和弦转换发生在哪一个时间点?乐手的独奏具体用了什么技巧?这要求模型保持极高的时间精度,能够一路紧盯音乐的时间轴。

这就带来了技术逻辑上的天然矛盾。通常的做法是用同一个音频编码器通吃这两类任务,结果模型在压缩整体概念和保留时间细节之间左支右绌。再加上行业内极度缺乏带秒级标注、和弦转折点等精细时间线的训练数据,测评体系也多偏向静态风格分类,导致市面上的主流多模态模型长期处于“时间盲”的状态。

双编码器融合与三阶段训练:GaMMA 的解题思路

复旦字节联手发布GaMMA大模型!攻克音乐时序理解难题

1. 两个专家各司其职

既然用一个编码器做不好,GaMMA 的选择是“术业有专攻”。他们设计了双编码器融合网络(DFN),装载了两个基于 Whisper 改造的专用编码器:

  • 时序专家(Temporal Expert):针对带时间戳的段落边界、节拍、和弦进行专项微调,专门盯防那些转瞬即逝的时间节点。
  • 全局专家(Global Expert):负责抓流派、情绪、整体编配和整体听感。

两个专家提取到的特征,通过双向交叉注意力机制互相通话,让“时序”带上全局视野,让“全局”知晓细节动态。接着,一个可学习的门控路由模块会在 token 级别动态调整两者的比重,输出最终的音频表征。

2. 渐进式三阶段训练方案

为了让架构落地,研发团队制定了一套环环相扣的高强度训练计划:

  • 第一阶段:多模态对齐。在数百万音乐-文本对上训练。在此阶段,系统将 60 秒内的音乐片段与对应的多语言歌词进行切分和对齐,冻结 LLM 部分,仅仅训练连接音频和文本的 Projector 模块,完成声音到文本空间的基础认知绑定。
  • 第二阶段:监督微调(SFT)。进入实战教学。团队利用 SongFormer 工具先把音乐切成秒级的结构块,然后通过 Gemini 2.5 Pro 生成细致的音乐分析。这批语料全部经过有音乐人背景的专家进行人工精细修正,甚至把 11 个音乐维度的专业概念套入模板,再让 GPT-5.1 将提问方式改写得更加接地气,最后以高难度的多轮对话形式喂给模型,此时音频长度也放宽到了 300 秒。
  • 第三阶段:强化学习(GRPO)。用组相对策略优化算法进行进阶微调。首先通过 Monte Carlo 推理剔除掉太容易和太难的“无效题”,只留下难度适中的样本进行推理链拓展。给出的音乐和问题仅判断对错及格式一致性,通过奖励机制引导模型实现稳定、准确的长音频推理。

MusicBench 基准出炉:硬核实测跑赢巨头

复旦字节联手发布GaMMA大模型!攻克音乐时序理解难题

为了验明正身,研发团队顺手推出了迄今最大、最细致的音乐测评基准 MusicBench。这个库包含 3,739 道人类专家标注的选择题,包括偏向属性分类的 Global 子集(2,741 题)以及专门卡死时间线的 Temporal 时间子集(998 题)。

在与各大模型的贴身肉搏中,GaMMA 的表现非常抢眼:

复旦字节联手发布GaMMA大模型!攻克音乐时序理解难题

在 MuChoMusic 基准评测中,GaMMA-8B 拿到了 78.0% 的总体准确率,压制了 Kimi-Audio(68.2%)和 Audio-Flamingo3(73.4%)。当底座换成 Qwen3-14B 时,这一准确率被进一步刷到了 79.0%。

复旦字节联手发布GaMMA大模型!攻克音乐时序理解难题

在自家设置的 MusicBench 测试中更是如此:GaMMA-8B 在全局判断上得分 82.6%,领先 Gemini-3.0 Pro 的 80.4%。而在时序任务的对抗中,GaMMA-14B 的和弦感知能力达到了 75.0%,相比之下 Gemini-3.0 Pro 仅有 53.0%,这个提升幅度堪称碾压。在结构拆分(86.5%)和歌词同步对齐(95.5%)这些涉及毫秒级直觉的场景里,GaMMA 同样保持了显著优势。

真实对话实录:它到底多懂音乐?

数据指标虽然好看,但真刀真枪的对话效果往往更能说明问题。研究团队展示了几组无歌词、无信息盲听的多轮人机交互,GaMMA 的输出呈现出了极强的音乐素养。

以达达乐队的老歌《南方》为例,当用户询问音频中那段推动情感高潮的呐喊在哪个时段时,GaMMA 精确地给出了反馈:“那其实是长达一分钟的吟唱,从 2:35 左右开始,持续到了 3:32 上下。主唱通过这个长段里反复高亢的吟唱,将背景音乐层层推向整首歌的顶峰。”不仅准确找出了起始点,还能体会到编曲的意图。

又如输入重金属版《让我们荡起双桨》时,它一针见血地指出这种反差感源于“高亢摇滚乐编曲与极致简单儿歌旋律的情感膨胀与碰撞”,表现出了成熟的人类直觉。

即便是面对更专业的音乐结构解析请求,GaMMA 也能有条不紊地将音频的时间段、和弦走向(如 Fmaj – Cmaj – Gmaj – Amin 的变化及时间区间)、配器变化、4/4 拍律动细节写出逻辑明晰的分析报告。不得不承认,在攻克音乐时序这条长廊的路上,GaMMA 已经迈出了坚实的第一步。未来无论是用作音乐制作助手,还是作为更高级的娱乐多模态插件,这种能精确锁定时间维度的感知模型都将大有可为。

复旦字节联手发布GaMMA大模型!攻克音乐时序理解难题

复旦字节联手发布GaMMA大模型!攻克音乐时序理解难题

© 版权声明

相关文章