读懂音乐时间线到底有多难?复旦与字节联手打造GaMMA,多模态大模型终于学会“按秒听歌” 音乐时序理解一直是多模态大模型的致命短板。复旦联合字节推出GaMMA模型,创新采用双编码器融合网络与GRPO强化学习,让大模型真正读懂音乐时间线。实验表明,它在音乐结构拆解与时序任务上超越Gemini... AI 前沿动态# GaMMA# GRPO强化学习# 多模态大模型 2个月前380