MoE路由也能“长记性”:RMS-MoE用历史专家协作降低推理成本
导语:RMS-MoE让MoE路由复用历史专家协作,兼顾准确率、延迟与稳定性。

随着大模型参数规模持续膨胀,Mixture-of-Experts(MoE,混合专家模型)已经成为提升模型容量、控制单次推理计算量的重要技术路线。它通过“稀疏激活”让每个输入只调用少数专家,从而避免所有参数都参与计算。然而,在搜索、问答、智能客服、多轮对话等真实 Web-scale 场景中,MoE 的路由机制仍有一个关键短板:传统路由器通常是“无记忆”的。
来自马上消费金融、南京航空航天大学、阿里巴巴等机构的研究团队在 WWW 2026 论文中提出 RMS-MoE(Retrieval-Memory Synergy Mixture-of-Experts),试图让 MoE 路由从一次性的即时判断,升级为“检索—记忆—融合”的动态过程。它不只根据当前输入选择专家,还会检索历史上相似输入曾经激活过的有效专家组合,并与实时路由结果结合,从而提升准确率、推理延迟和路由稳定性。

- 论文标题:Rethinking MoE with Retrieval-Memory Synergy: Towards Efficient Expert Coordination
- 会议:The ACM Web Conference 2026(WWW 2026)
- 作者:Wanjie Tao, Qun Dai, Yantong Lv, Quan Lu, Ning Jiang, Zulong Chen
- 机构:马上消费金融、南京航空航天大学、阿里巴巴
- 论文链接:https://dl.acm.org/doi/epdf/10.1145/3774904.3792922
MoE为什么需要“记忆”?
MoE 的核心优势在于稀疏激活:面对一个输入,路由器会从多个专家中选择少数几个参与计算。这让模型可以拥有更大的总参数量,同时控制每次前向传播的计算开销。典型的 MoE 系统会为每个 token 或输入片段计算路由分数,再选出 top-k 专家执行计算。
问题在于,当前主流 MoE 路由方式大多遵循一种 stateless paradigm,也就是“无状态范式”。每个输入被独立处理,模型并不会系统性利用过去相似输入的专家选择经验。换句话说,即便模型此前已经在一批相似查询上找到了表现良好的专家组合,下一次遇到类似问题时,路由器依然可能从头做判断。
在离线 benchmark 中,这种问题未必显眼;但在真实 Web 场景里,它会被显著放大。搜索请求、开放域问答、客服咨询和多轮对话往往存在大量语义重复:用户会用不同措辞询问相同问题,或者反复出现同类任务。如果每次都重新探索专家分配,就会带来三类成本:
- 重复计算:相似输入反复触发新的专家选择过程,增加推理延迟和资源消耗。
- 路由不稳定:输入表达稍有变化,就可能激活完全不同的专家集合,影响模型输出一致性。
- 协作关系难沉淀:传统路由更多是在给单个专家打分,而不是复用历史上已经验证有效的“专家团队”。
RMS-MoE 的出发点正是:既然真实用户请求具有重复性,那么专家协作模式也应该可以被记住和复用。与传统 RAG 从外部知识库检索文本内容不同,RMS-MoE 检索的是模型内部的专家激活模式,可以理解为一种 architectural memory——让模型记住自己过去如何调度专家。
从即时路由到检索增强路由
RMS-MoE 的整体框架由三个核心模块组成:Co-Activation Memory(CAM)、Adaptive Fusion Module(AFM)以及 Reinforcement-Guided Memory Update。三者分别负责存储与检索专家组合、融合记忆先验与实时判断、根据任务反馈持续维护记忆质量。

当一个新输入进入模型后,RMS-MoE 会首先通过 Input Encoder 得到输入表示,同时标准 router 生成当前输入对应的实时专家激活结果。与此同时,CAM 会根据输入 embedding 在记忆库中检索最相似的历史样本,并读取这些样本对应的专家激活模式。随后,系统根据相似度和历史效用信息对专家组合进行聚合,形成 memory prior,即“历史上相似输入更适合哪些专家团队”的先验判断。
最后,AFM 会学习一个动态融合权重,把 memory prior 与实时 router 输出结合,得到最终专家激活结果。这样一来,对于熟悉、重复、语义相近的输入,模型可以更多依赖历史上验证有效的专家团队;对于新颖或低相似度输入,模型仍能回退到实时路由,保留探索能力和灵活性。
Co-Activation Memory:记住的不是文本,而是专家团队
Co-Activation Memory 是 RMS-MoE 的关键设计。它可以被理解为一个动态 key-value memory:每条记忆的 key 是输入 embedding,value 则是该输入对应的专家激活模式,以及与其相关的元信息,例如历史 reward 和最近使用情况。
新输入到来时,模型会用当前 embedding 去 CAM 中检索 top-K 个相似条目。每个条目都代表一个历史相似输入,同时携带其曾经激活过的专家组合。RMS-MoE 会结合检索相似度与历史效用,对这些专家组合进行加权聚合,生成专家选择先验。
这一设计的关键在于,它把“专家之间的共同激活关系”视为一种可复用的结构知识。传统 MoE router 往往独立判断每个专家是否应该被选中,而 RMS-MoE 关注的是哪些专家曾经一起有效工作。它不是简单地缓存输出结果,而是在复用模型内部的计算路径和专家协作经验。
Adaptive Fusion:在记忆与实时判断之间动态取舍
仅有记忆并不够。如果模型过度依赖历史经验,遇到新任务、新表达或低频场景时就可能发生错误迁移。因此,RMS-MoE 引入 Adaptive Fusion Module,用一个可学习的动态门控系数 β 控制 memory prior 和实时 router 输出之间的权重。
当当前输入与 CAM 中的历史样本高度相似时,β 会更大,模型更倾向于采用记忆检索得到的专家组合;当相似度较低时,β 会降低,模型则更多依赖当前 router 的即时判断。因此 RMS-MoE 并不是一个简单缓存系统,而是一个根据输入熟悉程度自适应决策的路由框架。
用更直观的话说,RMS-MoE 的策略是:熟悉的问题,优先复用历史上表现好的专家团队;陌生的问题,回退到当前路由器;边界模糊的问题,则在记忆和实时判断之间动态折中。
强化反馈式更新:让记忆库持续进化
为了避免 CAM 变成静态缓存,论文设计了 reinforcement-guided memory update。训练过程中,模型会根据任务反馈更新记忆条目的效用分数。论文使用负训练损失作为 reward 信号,并通过指数滑动平均更新历史 reward。
同时,CAM 会记录条目的新近程度。当记忆容量受限时,系统会基于 utility-recency score 进行淘汰:如果某个专家组合多次带来较好任务表现,它更容易被保留并在后续被检索;如果某个组合长期无效或已经过时,则会被削弱甚至移除。
此外,CAM 的更新采用异步机制。模型不会在每次前向传播时同步修改检索索引,而是把更新操作先缓冲起来,再批量执行。这一设计降低了在线更新的系统开销,也避免检索索引变化对梯度计算造成干扰。
实验:在WebQA和MultiWOZ上同时改善效果与延迟
论文主要在 WebQA 上评估 RMS-MoE。WebQA 包含 120 万个问答样本,并具有约 30% 的查询冗余,非常适合检验记忆增强路由在高重复 Web 场景中的效果。研究团队还在 MultiWOZ 上验证了该方法在多轮任务型对话中的泛化能力。
实验对比了多种强 MoE 基线,包括 Switch Transformer、Expert-Choice MoE、Hash-MoE、Soft-MoE 和 DeepSeekMoE。所有模型使用相同的 MoE 基础架构:32 个专家,hidden dimension 为 1024,每个 token 激活 top-4 专家。RMS-MoE 额外设置 CAM 容量为 10^5,并检索 top-5 个记忆条目。实验在 8 张 NVIDIA A100 GPU 上运行,并报告 10 次运行的均值和标准差。

在 WebQA 上,RMS-MoE 取得了最优结果。相较于 DeepSeekMoE,RMS-MoE 的 F1 提升 2.7 个点,归一化延迟从 0.72× 降至 0.53×,约降低 26%。相较于 Switch Transformer,RMS-MoE 的端到端延迟几乎减半。在 MultiWOZ 上,RMS-MoE 也保持相似趋势,实现了 2.5 个 BLEU 分数提升和 34% 的延迟降低。这说明 RMS-MoE 并不局限于单一问答任务,也能迁移到多轮对话场景。
消融实验:CAM是收益的核心来源
为了进一步分析各模块贡献,论文进行了消融实验。结果显示,移除 CAM 后,模型 F1 从 82.5 降至 77.3,稳定性从 0.94 降至 0.85,是性能退化最明显的设置。这表明历史专家协作模式的检索与复用,是 RMS-MoE 提升效果的核心来源。

移除 Adaptive Fusion 后,F1 降至 78.2,说明简单引入记忆并不足够,模型必须动态判断何时相信记忆、何时相信当前 router。移除 reinforcement-guided update 后,F1 降至 79.8,稳定性也有所下降,表明记忆质量需要持续维护,不能只依赖初始缓存。
敏感性分析显示,RMS-MoE 对关键超参数较为稳健。CAM 容量在 10^5 附近达到较好效果,top-K 检索数量在 K=5 时形成较优的准确率—延迟平衡,而融合门控 β 最终稳定收敛到约 0.6,说明模型在相当一部分决策中会主动利用记忆先验。
为什么RMS-MoE值得关注?
RMS-MoE 的意义不只是提出了一个新的 MoE 变体,更重要的是重新思考了 MoE 路由的本质。过去,MoE 路由通常被看作即时决策:给定当前 token,选择若干专家。RMS-MoE 则把它扩展为一个带有历史经验的动态过程:当前输入的专家选择不仅由实时 router 决定,也可以参考过去相似输入中已经验证有效的专家协作模式。
这带来了三个层面的变化。第一,路由从“无状态”走向“有记忆”,模型能够复用历史上成功的专家组合,减少重复探索。第二,专家选择从“单专家打分”走向“专家团队复用”,共同激活模式成为可检索、可强化、可淘汰的结构。第三,检索增强不再只发生在内容层,RAG 检索外部知识,而 RMS-MoE 检索模型内部架构行为。
对于 Web-scale 推理系统而言,这一点尤其关键。搜索、问答、对话、推荐和智能客服等场景都存在高频、重复、相似的请求。如何在保证模型效果的同时降低推理成本、提升响应稳定性,是大模型工程落地的核心问题之一。RMS-MoE 提供了一条轻量但有效的思路:让模型记住自己过去做过的有效计算,并在相似场景中复用。
随着大模型规模继续扩大,MoE 仍将是提升模型容量与推理效率的重要路线。但真正高效的 MoE 不应只是“稀疏激活更多专家”,还应能够学习和复用专家之间的协作规律。RMS-MoE 将检索、记忆与专家路由结合,为 MoE 架构引入 architectural memory。实验表明,这种设计能够在 Web-scale QA 和多轮对话任务中同时改善准确率、推理延迟和路由稳定性。
未来,当大模型更深入地部署在搜索、对话、客服和复杂任务系统中,如何让内部计算路径更稳定、可复用、可解释,将成为提升系统效率的重要方向。RMS-MoE 的启示是:大模型不仅需要记住外部知识,也需要记住自己“如何思考”以及“如何调度计算资源”。