从 Qwen3-VL 到 BARD-VL:上智院联手复旦开源多模态扩散模型,解码吞吐最高提升 3 倍!

导语:BARD-VL 通过桥接 AR 与 Diffusion,兼顾多模态性能与推理效率,实测吞吐最高提升 3 倍。

在多模态大模型的下一轮竞争中,“更聪明”已经不够,“更快、更省”同样关键。上海科学智能研究院联合复旦大学、上海创智学院等团队最新开源的 BARD-VL,给出了一个颇具代表性的答案:它不是从零训练一个扩散式视觉语言模型,而是把成熟的自回归(AR)VLM 平滑改造成扩散式(Diffusion)VLM,在尽量不损失能力的前提下,把推理效率显著拉高,实测解码吞吐量最高可提升 3 倍。

这项工作名为 BARD(Bridging Autoregressive and Diffusion),核心思路很直接:既然自回归模型已经在理解能力上很成熟,那就不要推倒重来,而是通过一套“桥接框架”把它迁移到更适合并行解码的扩散范式中。最终得到的 BARD-VL,基于 Qwen3-VL 转换而来,在多项视觉语言评测上不仅没有明显退化,部分指标甚至还能超过原始模型。

© 版权声明

相关文章

暂无评论

none
暂无评论...