CVPR 2026重磅:模型不是不会做,而是被“挤掉”能力!东南大学耿新团队提出必要子空间融合,多任务性能损耗直降20%

导语:多任务融合中模型性能“互相伤害”?东南大学耿新团队CVPR 2026研究发现,关键不在参数平均,而在如何分离并保护不同任务的核心知识方向。

你有没有遇到过这样的场景:一个图像识别模型,单独识别车辆时准确率高达95%;但当它被要求同时识别车辆、动植物和场景之后,车辆识别的准确率却掉到了82%以下。模型并非能力不足,而像是原有的知识被新任务“挤了出去”。

这种多任务融合中的性能坍塌现象,长久以来困扰着学术界和工业界。近日,来自东南大学的耿新团队在CVPR 2026上发表了一篇名为《Model Merging in the Essential Subspace》的论文,为这个问题提供了全新的解释和解决方案。他们指出,问题的根源不在于参数融合的数学技巧,而在于模型能力的存储方式——所有任务共享同一个表示空间,当新任务加入时,关键方向上的信息就会互相覆盖与竞争。团队提出的必要子空间融合方法(ESM),通过将不同任务的核心方向解耦并实施极化信号加权,让多个任务在同一个模型中稳定共存,性能损耗大幅降低,甚至逼近单任务微调的上界。

东南大学耿新团队CVPR 2026论文:必要子空间融合让多任务模型性能损耗降低20%

多任务融合为何总在“互相伤害”?

自从模型合并(Model Merging)技术兴起以来,人们一直希望将多个微调模型直接“拼”成一个全能模型,无需重新训练。但事与愿违,简单的参数平均法(如Task Arithmetic、TIES-Merging)在任务数量增多时,融合后的模型经常出现明显的性能滑坡。传统观点认为,这是因为不同任务的参数更新方向存在“冲突”,所以需要更精巧的冲突消除算法。

耿新团队却从更根本的层面提出疑问:模型的能力究竟是如何存储在参数里的? 他们通过一系列实验发现,决定任务性能的关键知识并不均匀分布在所有参数维度上,而是高度集中在少数几个功能方向——这些方向构成了所谓的“必要子空间”。当多个任务共享同一个模型时,它们的必要子空间如果发生重叠,就会相互挤占,导致某些任务的信息被覆盖;而作用较弱的噪声方向则在融合中产生干扰。这就是多任务融合失败的深层原因。

基于这一洞察,团队认为解决问题的关键不再是设计更复杂的参数融合算法,而是在融合前先找出每个任务的必要子空间,并将不同任务的子空间彼此分离。由此,他们发展出一套包含必要子空间分解(ESD)和极化缩放(Polarized Scaling)的两阶段方法,简称ESM。

ESM:从“参数拼接”到“知识重组”

第一步:必要子空间分解(ESD)——找到真正重要的方向

传统的子空间分解通常采用SVD(奇异值分解)对参数矩阵进行操作,但参数空间的变化并不直接对应模型行为的变化。ESD则另辟蹊径,直接在模型的输出空间上构造分解:他们利用少量无标签样本,记录模型在每一层对数据的响应,构建输出协方差矩阵,再对其进行特征分解。这样一来,得到的特征向量方向就反映了模型在处理任务时最依赖的变化基,而非参数数值的起伏。

实验证明,ESD能够以极少的维度保留更多有效信息。例如,当只保留5%的分解成分时,ESD得到的融合模型与原专家模型之间的特征一致性明显高于SVD方法。这说明ESD找到的确实是更靠近任务语义的内核结构,而SVD在低维度时更容易丢失关键知识。

第二步:极化缩放(Polarized Scaling)——让强信号更强,弱噪声更弱

即便找出了必要子空间,不同任务的信息在融合时仍会彼此竞争。研究团队发现,高范数(norm)的方向往往承载着更重要的任务知识,而低范数的方向更接近噪声。基于此,他们设计了一种非线性缩放规则:将每个方向上的权重按其范数与平均范数之比的平方进行放大或抑制。这类似于在信号处理中将强信号增益提高、弱信号压缩,从而实现多任务信号的有效共存。

更精妙的是,这种缩放被分解到三个层次:任务级防止某些任务被淹没,维度级突出最关键的特征方向,层级级消除残差结构带来的干扰。通过这种多粒度重加权,ESM能够同时解决“保留哪些信息”和“如何让它们和平共处”两大核心问题。

实验数据揭示ESM有多强

研究团队在一系列任务异构性极大的VLM基准上进行了系统验证,任务覆盖图像分类(Cars、SUN397)、文本情感分析(SST2)和手写数字识别(MNIST)等差异巨大的类型。主要结论如下:

  • 抗干扰能力突出:随着融合任务数量从2个增加到8个,传统基线方法的性能损耗通常达到8%~9%,而ESM的损耗幅度明显更小,整体损耗率相比基线降低了约20%。这说明ESM能更有效地抵御多任务带来的相互干扰。
  • 逼近单任务性能上界:未微调模型的平均性能在50%~65%之间,单任务微调专家模型约为90%+,而ESM达到了81%~91%,已经极其接近多任务融合的理想上限。这意味着多个任务合并后依然能高度保持各自的专有能力。
  • 小样本即收敛:仅使用每个任务1个无标签样本时,ESM效果就已超过baseline;4个样本时接近最优;32个样本后基本收敛。这强力证明任务子空间是模型内在的低维结构,不需要大量数据估计。
  • 数据不敏感:无论使用正常采样数据、单类别偏置数据还是完全无关的外部数据,ESM的表现几乎没有明显差异,进一步确认了子空间来源于模型本身,而非数据拟合的假象。
  • 大模型上的价值依然显著:在参数量更大的模型上,各种方法的性能基线已经达到90%以上,ESM相比强方法的提升收窄至0.3~0.5个百分点。这并非ESM失效,反而表明大模型本身具有更自然的子空间分离能力,ESM正是在容量有限模型上人为构造了同样的解耦机制。

从实验拆解看方法有效性

为了探究ESM为何有效,研究团队进行了细粒度的消融实验。将分解方法从SVD换成ESD后,性能直接从89.0提升到90.9(+1.9);再加入极化缩放,又从90.9提升到91.8(+0.9)。这清晰地表明:ESD主要解决信息丢失问题,极化缩放主要解决信息竞争问题,两者结合才产生最优效果。

进一步分析内部机制还发现,单独放大强信号或单独抑制弱噪声都能带来性能提升,但二者结合的效果最佳。这印证了多任务融合的本质并非简单的参数平均,而是一个信号筛选与重加权过程。

子空间公平分配与正交化确保共存

在融合操作中,团队还设计了精巧的公平策略。首先通过“等秩分配”保证每个任务获得的子空间维度相同(总维度/任务数),避免强任务占用过多表示空间。随后,对直接拼接的子空间进行正交化处理,强制不同任务的必要方向彼此独立,消除重叠引发的信号冲突。这一思想与PCA白化或信号去相关类似,确保了多个任务能够在有限的总容量内稳定共存。

这一整套流程揭示了一个更深层的原则:模型融合的成功与否,取决于我们能否在参数海洋中辨认出真正的知识岛屿,并为它们划定互不侵犯的边界。

研究者:耿新团队与学习基因思想

论文的通讯作者耿新教授是东南大学首席教授、研究生院常务副院长,也是新一代人工智能技术与交叉应用教育部重点实验室主任。他长期深耕机器学习、大模型与模式识别,曾获国家杰出青年科学基金、科学探索奖等荣誉。他提出的“学习基因”(Learngene)思想正是ESM的先导——主张从基础模型中提取可复用、可继承的核心能力,实现面向不同任务的灵活部署。另一通讯作者祁磊副研究员专注于计算机视觉与模式识别,在异常检测、领域泛化等方向成果丰硕。

参考链接:
https://palm.seu.edu.cn/xgeng/
https://palm.seu.edu.cn/qilei/

未来影响:更稳定、更便宜的多能力AI

ESM的价值不仅在于表格上的数字提升。它重新定义了模型融合问题:关注点从参数算术转向了知识结构的理解与重组。这一视角的转换,意味着未来的多任务系统不必每次增加新功能都重训一个大模型,也不必担心加入新能力会损伤旧能力。对普通用户而言,AI工具将更接近一个能力完整、不易“失忆”的通用助手;对企业来说,这有望大幅降低模型维护与部署的成本,催生更高效的本地智能服务。

从学术层面看,ESM揭示了一个重要事实:深度模型内部存在一种低维、稳定、可提炼的知识组织方式。沿着这条道路走下去,研究者或许不再只能靠堆数据、扩参数来提升智能,而可以通过理解并重组模型已经学到的知识来获得突破。这无疑为下一阶段的AI发展打开了新的想象空间。

© 版权声明

相关文章