CVPR 2026 | 多模态大模型如何看懂物种关系?北大团队提出TARA,层级识别准确率大幅提升
导语:如何让多模态大模型像生物学家一样理解物种层级?北大团队提出TARA,通过分类学知识对齐实现层级视觉识别突破。
多模态大模型在图像识别领域已取得长足进步,但当它们面对具有层级结构的视觉概念时,却常常犯错——比如将一只鸟归类为正确的目,却弄错了它的科或属。北京大学王选计算机研究所彭宇新团队的最新研究 Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models(TARA)瞄准这一痛点,提出了一种让模型真正理解“物种关系”的新方法,论文已被CVPR 2026接收。
现实世界中的视觉概念天然带有层级,生物分类体系的“界门纲目科属种”就是最典型的例子。然而大多数视觉模型仍基于扁平分类框架训练,在面对层级预测时容易出现分类路径不一致、上下层关系冲突等问题。更棘手的是,开放环境中存在大量训练数据未覆盖的未知物种,传统模型几乎无法进行有意义的推断。
TARA:用分类学知识对齐多模态表示
TARA的核心思想是引入生物基础模型(Biological Foundation Model, BFM)中蕴含的丰富分类学知识,并将其与多模态大模型的中间表征进行双向对齐,使模型学到具有层级结构约束的视觉表示。
具体而言,TARA包含两个对齐任务:
- 视觉表示对齐:利用BFM提取图像特征,同时取出多模态模型中间层的视觉特征,通过投影层将二者映射到同一空间,以余弦相似度进行对齐,迫使模型学习符合生物分类结构的视觉表示空间。
- 标签表示对齐:将分类标签输入BFM文本编码器获得层级标签嵌入,再将多模态模型生成答案的token表征映射到同一空间并进行相似度对齐,使模型掌握不同层级标签之间的语义关系。
训练采用交替优化策略,一方面通过强化学习微调提升分类性能,另一方面通过上述对齐损失注入分类学知识。强化学习部分使用了“No-Thinking”策略,直接要求模型输出答案而不进行中间推理,奖励函数仅根据预测正误给出0或1的二元奖励。TARA额外增加的投影层计算开销极低,几乎不影响训练效率。
实验验证:从已知到未知的全方位提升
研究团队在多个数据集和指标上进行了严格评估。首先在iNaturalist-2021(iNat21)数据集上测试已知类别识别能力。该数据集包含完整的六级生物分类体系,植物子集含4271个物种,动物子集含5388个物种。
引入TARA后,Qwen3-VL-2B模型在iNat21-Plant上的层级一致性准确率(HCA)从9.23%提升至12.78%,叶节点准确率(Accleaf)从31.96%升至32.66%;在iNat21-Animal上HCA从8.57%提升至10.26%,Accleaf从29.32%升至30.77%。对于更大的Qwen2.5-VL-3B模型,HCA更是在植物子集上达到19.53%,动物子集上达到24.02%,层级评价指标POR、S-POR、TOR也普遍提升3%~6%。
在开放世界识别任务上,TerraIncognita数据集包含了大量稀有或未知昆虫物种。实验显示,TARA使已知类别下的目级F1从23.30跃升至41.56,科级F1从11.47升至25.47;当面对训练中从未见过的物种时,目级F1仍能从23.30提升至33.45,科级F1从11.47提升至12.67——证明模型真正学到了可迁移的分类学知识,而非简单记忆。
线性探针实验进一步揭示了表征质量的进步:从模型最后一层提取视觉token并训练线性分类器,添加TARA后iNat21-Plant分类准确率从13.30%(基础模型)→14.40%(+强化学习)→18.30%(+TARA),表明模型学到了更具判别力的特征。
在复杂视觉问答任务ImageWikiQA上,TARA同样带来增益:准确率从46.60%→48.70%→51.40%,说明层级视觉理解的提升能够反哺高层语义推理。
训练效率方面,TARA模型在早期训练步数中即超过基线,同等步数下HCA和叶节点准确率始终更高,收敛速度明显加快。
让视觉模型学会“推断未知”
TARA的意义不止于性能数字。它提供了一种通用范式:通过中间表征对齐将结构化领域知识注入多模态大模型。这种方法不仅能用于生物分类,还可轻松迁移至医学影像层级诊断、商品SKU分类体系、知识图谱推理等任何具有层级结构的场景。
该工作也向着通用视觉理解系统迈出了一步。未来的AI不应只满足于辨识物体,还需理解对象之间的层级、从属、并列等关系。TARA展示了一条可行路径——让模型在现有数据中学习层级先验,从而在开放世界中面对未知时仍能做出合乎门类纲目的合理推断。
团队介绍
论文第一作者何胡凌霄,北京大学王选计算机研究所博士生,师从彭宇新教授,主要研究方向为细粒度多模态大模型,已在CVPR、ICLR、ICDE等国际会议发表多篇论文。
通讯作者彭宇新,北京大学王选计算机研究所教授、博雅特聘教授,IEEE/CCF/CAAI/CIE/CSIG Fellow,国家杰出青年科学基金获得者。他长期从事多媒体分析与计算机视觉研究,发表TPAMI、CVPR、NeurIPS等顶级论文170余篇,主持国家级科研项目40余项,团队多次在TRECVID等国际评测中斩获第一。
论文地址:https://arxiv.org/pdf/2603.00431