部署即学习:CASCADE让LLM Agent在任务流中持续进化,无需更新模型参数
导语:CASCADE让LLM Agent在真实部署中无需更新参数即可通过在线经验学习持续提升,在16个任务上显著超越零样本和静态案例库。
引言:大模型Agent的部署挑战
当LLM Agent进入真实应用后,面对的不再是一次性的静态测试集,而是持续到来的任务流。每一次工具调用、代码执行或网页搜索都会产生隐式的反馈:成功还是失败?工具选对了吗?这些部署阶段自然产生的信号,能否反过来帮助Agent变得更聪明?
来自伦敦大学学院、吉林大学和伦敦国王学院的研究团队给出了他们的答案:部署时学习(Deployment-Time Learning,DTL)以及对应的实现框架CASCADE。它不满足于简单积累经验,而是让Agent在在线任务流中学会选择经验:面对当前任务,应该参考过去哪一次交互,才能做出更好的决策?
CASCADE:把部署变成在线学习
传统Agent经验学习往往沿用离线训练-测试范式,先在训练集上微调或构建记忆库,再在固定测试集上评估。另一种方式则关注运行时学习,但通常是在同一个数据集上反复多轮观察性能爬升。这些设定都忽略了真实部署的时间维度:任务按顺序到来,Agent无法预知未来,也不能随意回滚重试。每一步既是一次服务,也是一次反馈收集;当前的选择不仅决定这次结果,还会影响后续策略。

CASCADE将部署阶段形式化为一个在线学习问题:在第t步,Agent接收一个查询,生成答案或行动轨迹,环境返回成功/失败的二值反馈。优化的目标不再是单次任务,而是整个部署序列上的长期成功率——等价于降低在线学习中的遗憾(Regret)。这一设定更贴近工业界的持续服务场景,也为评估Agent的部署适应能力提供了清晰的数学表达。
基于案例的4R循环与上下文赌博机
CASCADE以基于案例的推理(Case-Based Reasoning)为骨架。当新任务到达时,系统从不断增长的历史库中检索相关成功案例,将其作为上下文提供给LLM,再根据反馈决定是否存为新案例。其核心在于将“检索哪个案例”建模为上下文赌博机(Contextual Bandit)问题:当前查询是上下文,候选案例是可选择的动作,Agent选择案例后LLM生成结果,环境返回二值奖励,检索器据此更新策略,在后续任务中更好地权衡探索与利用。

具体流程遵循经典的4R步骤:
- 检索(Retrieve):从案例库中挑选可能最有帮助的历史案例;
- 复用(Reuse):将案例作为上下文增强LLM的决策;
- 修改(Revise):生成最终答案或动作序列;
- 保存(Retain):若环境反馈成功,则把本次交互作为新案例入库。
为实现高效的在线检索策略学习,论文提出了Neural‑LinLogUCB算法。它使用Transformer捕捉查询与案例间的交互表示,并通过线性头输出不确定性估计,从而在二值反馈下进行稳健的赌博机学习。这使得检索器能够持续判断哪些案例在当前任务中最有用,即使底座LLM的参数从未改变。
理论保证:遗憾分解与无遗憾学习
从理论角度看,CASCADE将整体遗憾分解为两部分:
- 覆盖差距:案例库是否已经包含足够相关的历史经验;
- 检索遗憾:在已有候选案例中,检索策略是否选中了最佳的那个。

随着部署推进,成功案例不断入库,覆盖不足带来的损失会自然降低;同时检索器通过二值反馈逐步优化,检索遗憾随之减少。在合理假设下,CASCADE可以获得无遗憾学习保证。这意味着Agent在长期运行中,平均性能不会比使用事后最优固定案例库差,甚至能持续逼近更优策略。
DTLBench:跨领域的部署时学习基准
为了系统评估,研究团队构建了DTLBench,涵盖医疗诊断、药物推荐、法律判决预测、金融意图路由、根因分析、Text‑to‑SQL等12个单轮任务,以及ALFWorld、ScienceWorld、基于网页的深度搜索和电子健康记录表格推理等4个多轮任务。所有任务都被组织为在线序列,Agent必须按顺序处理,只能使用已经发生的历史交互和反馈,真实复现了部署环境。

实验结果:无需更新模型,性能持续提升
在使用Qwen3‑32B作为底座模型时,零样本提示的平均成功率仅为48.33%。简单的非参数案例库基线(NP‑CBR,即固定规则检索)将成功率拉升至63.76%,证明了案例复用的价值。而CASCADE进一步将平均成功率提升至66.68%,体现出在线检索策略学习的增益。
与需要更新模型参数的REINFORCE+LoRA基线相比,CASCADE在12个单轮任务中的9个上表现更优,其余任务也基本持平,且学习过程的显存占用低于4GB,极为轻量。此外,CASCADE对模型规模不敏感:在Qwen3的4B、8B、14B、32B版本上均稳定带来提升;甚至对于黑盒API模型gemini‑2.0‑flash,在可评估的9个任务上,CASCADE将平均成功率从56.58%(零样本)推高至72.58%,超越了NP‑CBR的70.68%。这表明部署时学习完全能够适应无法访问内部参数的商业模型。
在多轮交互任务中,CASCADE同样表现亮眼:ALFWorld成功率从62.01%提升到67.43%,ScienceWorld从59.36%提升到66.84%。在基于网页的深度搜索和电子健康记录推理任务上,成功率分别有大幅上升,并显著减少了调试轮数。例如,电子健康记录表格推理任务中,零样本成功率仅20.75%,NP‑CBR为44.02%,CASCADE达到55.76%。
总结:部署本身,就是一次学习
CASCADE试图回答一个越来越重要的问题:当任务持续到来、反馈不断产生,而底座模型参数固定时,Agent如何在真实交互中持续变强?
论文的贡献可概括为三点:
- 提出部署时学习,将LLM Agent的部署阶段形式化为无参数更新的在线经验学习问题;
- 提出CASCADE框架,通过基于案例的推理和上下文赌博机,实现原理驱动的在线经验学习;
- 构建DTLBench,在16个跨领域任务上评测Agent在线任务流中的长期表现。
CASCADE的重点不在于重新证明“经验有用”,而是进一步指明部署过程本身可以被建模、评测和优化。随着Agent系统进入更开放、更长程、更依赖工具的复杂场景,如何在真实任务流中利用反馈进行稳定学习,必将成为大模型应用落地的核心课题。




