腾讯混元团队重磅研究:AI推理阶段实时动态适配,告别固定参数时代!
导语:腾讯混元团队最新研究HY-WU,提出让AI在推理阶段动态生成参数,同一模型可实时适应不同任务,性能大幅领先。
传统机器学习系统大多建立在这样一个前提之上:模型一旦训练完毕,其参数便基本固定,无论面对何种输入,都依赖同一套参数完成推理。这种范式在过去十多年里取得了巨大成功,模型能力的提升主要依赖于更大的模型规模、更多的训练数据以及更长的训练时间。然而,随着人工智能逐渐渗透到更加复杂多变的应用场景,这种“固定参数”方式的局限性开始显现。
现实世界中的任务往往高度多样化,不同的用户需求、不同的任务目标甚至可能彼此冲突。以图像编辑为例,同一张图片可能对应截然不同的修改要求——有的需要增强细节(如去模糊或图像修复),另一些则需要弱化细节(如添加模糊效果或模拟老照片老化)。如果模型始终使用同一套参数,它往往只能在相互矛盾的目标之间寻求折中,从而影响最终表现。
过去,研究者通常通过领域自适应(domain adaptation)或模型微调来缓解这一问题。当模型进入新领域时,需要重新训练或调整参数以适应新的数据分布。但这种方式意味着额外的训练成本,也增加了系统部署和维护的复杂度。那么,能否实现推理阶段的实时适配?
近日,腾讯混元无相团队发表论文《HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing》,提出了一种全新的思路:让模型在推理阶段根据当前输入动态生成适合该任务的参数,而非一直依赖固定参数。通过这一机制,同一个基础模型在面对不同任务时可以展现出截然不同的行为模式,从而实现更加灵活的实时适配能力。
四大实验验证动态参数的优势
为验证核心观点——如果模型能够针对每个输入动态生成参数,那么在复杂任务中的表现将显著优于固定参数模型——研究团队设计并开展了四类严格实验。
人类评测:HY-WU 胜率大幅领先主流模型
团队进行了大规模人工评测。具体流程是:在同一输入图片和编辑指令下,让不同模型分别生成编辑结果,然后由人类评审在两个结果中选择更好的一幅,并统计最终胜率。结果显示,HY-WU 在多个主流模型对比中优势明显:对 Step1X-Edit 的胜率约为78.4%,对 Qwen-Image-Edit 的胜率约为70.5%,对 LongCat-Image-Edit 的胜率约为68.3%,对 FLUX.2 的胜率约为55.5%。在与部分闭源商业系统比较时,对 Seedream 4.5 的胜率约为55.6%,对 GPT Image 1.5 的胜率约为55.5%。与最先进的商业系统 Nano Banana 系列相比,HY-WU 的表现略微落后,但整体差距不大。这些数据表明,动态生成参数的方式在视觉编辑效果上具有明显优势。
自动评测:WU-Eval 全面评估参数生成效果
除人工评测外,研究人员还设计了自动评估系统 WU-Eval,从指令对齐、内容一致性、结构合理性和图像质量四个维度进行评价。HY-WU 取得了最高的总体得分4.27,其中一致性得分4.13,结构得分4.30,质量得分3.98。与最强开源模型相比,一致性提高约0.27,结构提高约0.23。这说明动态参数生成机制能够显著提升图像编辑过程中的稳定性和结构保持能力。
公开 benchmark 评测:开源模型中的佼佼者
研究团队还在两个公开图像编辑评测数据集上进行了测试。在 GEdit-Bench 上,HY-WU 在所有开源模型中排名第一;在 ImgEdit-Bench 上,HY-WU 的总体得分为4.05,在开源模型中排名第二。这表明该方法不仅在内部实验中有出色表现,在公开评测环境中同样具备强大竞争力。
冲突任务实验:动态参数有效避免任务干扰
为测试模型在矛盾指令下的表现,研究人员设计了一组互相冲突的编辑任务,例如去模糊与添加模糊、图像修复与模拟老化等。实验比较了三种策略:Single LoRA(每任务独立模型)、Shared LoRA(多任务共享同一模型)以及 HY-WU 动态参数方法。结果显示,Single LoRA 在对应任务上表现极佳,但无法处理其他任务,出现了过度专门化;Shared LoRA 虽能处理所有任务,但效果被严重折中,例如在去模糊和模糊之间产生“半模糊”结果;唯有 HY-WU 能够正确执行每一个任务,且不同任务之间互不干扰,证明动态参数生成能有效解决任务冲突问题。
HY-WU 系统架构:从条件提取到动态参数生成
HY-WU 本质上是一套动态参数生成框架,其核心在于推理阶段根据输入实时产生任务专属的参数。系统处理流程分为三个阶段。
条件信息提取
系统分别从输入图像和文本指令中提取特征,并将两种模态的信息融合成一个统一的条件表示。该表示同时编码了视觉内容和编辑需求,为后续参数生成提供了关键依据。
模型参数生成
提取到的条件信息被送入一个基于 Transformer 架构的参数生成网络。该网络并非直接生成图像,而是输出一组模型参数更新,这些更新以 LoRA adapter 的形式存在。LoRA 是一种参数高效更新方法,可在不修改原模型主体的情况下改变模型行为。这样,参数生成网络就能根据当前输入条件,动态产生适配该任务的参数调整。
图像编辑执行
生成的 LoRA adapter 被插入到基础模型中,使模型以新的参数结构运行。随后,基础模型在这些参数的作用下完成图像编辑并输出结果。因为每个输入都会触发生成独特的参数,所以即使同一个基础模型,面对不同任务也能表现出差别化的行为模式,从而提升整体适应能力。
训练策略:端到端直接优化,无需预存大量模型
传统参数生成研究往往需要预先训练大量模型,再通过学习重建这些模型参数来训练参数生成网络。这种方式存储和训练成本高昂。HY-WU 采用了一种更直接的训练方式:输入图像和指令后,由参数生成网络生成模型参数,然后利用这些参数在基础模型中生成编辑图像,接着根据编辑结果与真值之间的差异计算损失,最后反向传播更新参数生成网络。整个流程概括为五个步骤:输入图像和指令、生成模型参数、生成编辑图像、计算损失、更新参数生成网络。这种端到端训练策略直接围绕最终任务目标进行优化,避免了存储和管理大量模型参数的麻烦,使参数生成机制更加灵活高效。
从一个模型到无限可能:实时适配的未来
从技术层面看,HY-WU 是一种新颖的图像编辑方法,但从更宏观的视角,它实际上提出了一种新的模型适应范式。传统模型依赖固定参数应对所有任务,而现实世界的问题多样且持续变化。一套参数很难同时适应所有情况,因此模型在复杂环境中的表现常受限制。虽然领域自适应和微调能改善特定场景的效果,但每次适应都需要重新训练,部署和维护成本较高。随着模型规模增长,研究者开始探索让模型在运行过程中自动适应任务的新思路。HY-WU 正是这一思路的具体实现:它学习的是如何根据输入生成合适的参数更新,而非一组固定的参数。
一个真正强大的模型需要具备两种关键能力:其一,能够根据不同任务动态调整自身行为;其二,这种调整必须实时发生。如果每次适应都需要重新训练,系统在真实环境中将大受掣肘。HY-WU 的核心意义正是在于实现了推理阶段的实时适应机制。模型在处理每个输入时,都会动态生成一组新参数,使自身行为与当前任务对齐。同一套基础模型因此能在不同任务之间灵活切换,表现出多样的行为模式。从长远来看,这项研究为未来 AI 系统的发展指明了新方向:未来的智能系统可能不再依赖单一的固定模型,而是能够在运行过程中实时调整参数结构,持续适应不断变化的任务环境与复杂场景。