CVPR 2026 | 北大彭宇新团队TARA:让多模态大模型看懂物种关系,未知物种也能准确推断
导语:CVPR 2026亮点:北大彭宇新团队提出TARA,创新地将生物分类学知识对齐到多模态大模型中,使模型真正看懂物种关系,甚至能识别从未见过的物种。
多模态大模型的层级视觉理解困局
近年来,多模态大模型在图像分类、目标检测和视觉问答等任务中取得了长足进步,但在面对具有复杂层级结构的视觉识别任务时,仍然显得力不从心。现实世界中的许多视觉概念天然存在层级关系——例如生物分类学中的“界—门—纲—目—科—属—种”体系、商品类目的多级细分以及疾病诊断中的层级编码。这些任务不仅要求模型识别出具体的类别,更需要理解不同层级之间的语义从属关系与结构一致性。
现有视觉模型大多基于扁平化标签进行训练,当被要求给出一条完整的分类路径时,很容易出现“分类路径不一致”或“层级关系冲突”的尴尬。例如,模型可能将一只鸟先正确识别为“鸟类”,却在科或属的级别上跳转到哺乳动物的分支,出现逻辑矛盾。与此同时,在开放世界环境中,模型还需具备识别未知类别的能力。以生物识别为例,现实物种数量远超现有数据集的覆盖范围,新物种不断被发现,传统模型在训练数据未包含的类别上往往束手无策。如何利用已有分类学知识帮助模型理解层级结构,并在有限数据条件下合理推断未知类别,已成为当前视觉智能研究的一大挑战。
TARA:用分类学知识对齐视觉表征
面对上述难题,北京大学王选计算机研究所彭宇新教授团队在论文《Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models》中提出了全新方法TARA(Taxonomy-Aware Representation Alignment,分类学感知的表征对齐)。该方法巧妙地引入生物基础模型(BFM)中蕴含的分类学知识,将其与多模态大模型的中间层表征进行对齐,从而使模型能够学习到具有清晰层级结构的视觉表示,显著提升层级识别的一致性和对未知类别的泛化能力。论文已被CVPR 2026接收,并引起广泛关注。
TARA的核心思想是通过两个对齐任务向多模态模型注入结构化知识。第一个任务是视觉表示对齐:利用生物基础模型从图像中提取特征,同时获取多模态模型中间层的视觉特征,然后将两者映射到同一特征空间,并最大化余弦相似度。这样,多模态模型就被迫朝着符合生物分类结构的方向调整自己的视觉表示空间。第二个任务是标签表示对齐:将层级分类标签(如“动物界-脊索动物门-鸟纲-雀形目-裸鼻雀科-蓝锥嘴雀”)输入BFM的文本编码器得到标签嵌入,再将多模态模型生成答案时的token表征映射到相同空间进行对齐,从而让模型学会不同层级标签之间的语义关系。
训练过程中,TARA与强化学习微调策略交替进行。团队发现,在分类任务中不进行显式推理(即直接输出答案)反而效果更好,因此采用“No-Thinking”强化学习,奖励函数为正确答案1分,错误答案0分。TARA仅增加了少量投影层,计算开销极小,却能让模型在吸收分类学知识的同时,加速收敛、提升性能。
实验验证:层级一致性大幅提升,未知物种也不在话下
研究团队在多个权威数据集上对TARA进行了全面验证。首先,在iNaturalist-2021(iNat21)数据集上测试已知类别的识别能力。该数据集包含植物4271个物种、动物5388个物种,每个样本带有完整的六级分类标注。以Qwen3-VL-2B基础模型为例,在iNat21-Plant子集上,引入TARA后,层级一致性准确率(HCA)从9.23%提升至12.78%,叶节点准确率(Accleaf)从31.96%提升至32.66%,而路径重叠率(POR)、严格路径重叠率(S-POR)和层级连贯率(TOR)等指标也分别提高3~6个百分点。在iNat21-Animal子集上,HCA从8.57%提升至10.26%,Accleaf从29.32%提升至30.77%。对于更大的Qwen2.5-VL-3B模型,HCA在植物上达到19.53%,动物上达到24.02%,所有指标稳定提升。这说明TARA对不同规模的模型均有效。
更为关键的是未知类别识别能力。团队在TerraIncognita数据集上进行了测试,该数据集收录了许多稀有或未正式记录的昆虫物种,部分甚至从未在训练中出现。结果显示,在有已知类别的测试场景下,目(Order)级别的F1从23.30提升至41.56,科(Family)级别的F1从11.47提升至25.47;而在纯未知类别场景下,目F1从23.30提升至33.45,科F1从11.47提升至12.67。这一结果有力证明,TARA不仅没有让模型死记硬背训练类别,反而真正学会了分类学的组织逻辑,能够推理出陌生物种的层级归属。
为进一步探究表征质量,团队进行了线性探针实验。他们提取模型最后一层的图像token表征,训练一个线性分类器来测试iNat21-Plant上的分类准确率。原始模型的准确率仅为13.30%,加入强化学习微调后达到14.40%,而再引入TARA后跃升至18.30%。这表明TARA帮助模型学到了更具判别力的视觉特征。
此外,在复杂视觉问答任务ImageWikiQA上,TARA同样带来了显著增益。基础模型准确率46.60%,强化学习微调后48.70%,加入TARA后进一步提升至51.40%。层级视觉理解能力的增强,间接推动了模型在需要深度推理的问答任务中的表现。最后,在训练效率方面,实验显示TARA模型在训练早期HCA和叶节点准确率就已经超越基线,且能在相同步数下保持优势,收敛速度更快。
精密的实验框架:从数据到评价指标
为了严谨评估,研究团队构建了一套完整的实验体系。数据集方面,除iNat21和TerraIncognita外,还引入了ImageWikiQA,它包含基于ImageNet图像的复杂问答,要求模型同时具备图像理解和知识推理能力。
基础模型选用Qwen3-VL-2B-Instruct和Qwen2.5-VL-3B-Instruct,两者在零样本视觉任务上表现强劲,适合作为基座。训练采用交替策略:强化学习专注于分类任务准确率,TARA负责知识对齐。评价指标更是精心设计:层级一致性准确率(HCA)要求整条分类路径完全正确,任何一级错误都判定为0分;叶节点准确率(Accleaf)衡量最细粒度的物种识别率;路径重叠率(POR)统计预测路径中正确节点的比例;严格路径重叠率(S-POR)则要求正确节点必须连续出现;层级连贯率(TOR)检查相邻层级预测是否自洽。这些指标从不同角度度量了层级识别的准确性和逻辑性。
从生物分类到通用智能:TARA的深远意义
这项研究不仅在学术上解决了多模态模型层级识别能力不足的痛点,更为实际应用打开了想象空间。TARA通过中间表征对齐的方式将领域知识注入大模型,这一思路具有普适性。除了生物分类,它还能推广至医学影像的疾病分级、商品类目的层级检索、知识图谱中的概念推导等需要结构化理解的场景。对于开放世界识别任务,TARA展示了模型利用已有知识推断未知的能力,为构建更加稳健、泛化性更强的视觉系统提供了新范式。
长远来看,未来的视觉智能系统不能只满足于“认出这是什么东西”,更要理解“这个东西在整体知识体系中的位置”。TARA让多模态大模型朝着理解复杂结构关系的目标迈出了坚实一步。正如团队所说,当模型学会了“生命之树”的枝桠分布,面对从未见过的物种时,也能根据枝干走向大致推断出它的归属——这种推理能力正是从感知智能走向认知智能的关键。
团队简介
该论文第一作者为何胡凌霄,北京大学王选计算机研究所博士生,师从彭宇新教授,主要研究方向为细粒度多模态大模型。他在CVPR、ICLR、ICDE等国际会议发表多篇论文,曾获国家奖学金等多项荣誉。通讯作者彭宇新教授是北京大学王选计算机研究所博雅特聘教授、IEEE/CCF/CAAI Fellow,国家杰出青年科学基金获得者,长期从事多媒体分析、计算机视觉和人工智能研究,发表TPAMI、CVPR、NeurIPS等顶刊顶会论文170余篇,其团队在TRECVID视频检索国际评测中多次夺冠,相关成果已应用于国家重要部门及互联网企业。