多轮Agent蒸馏不翻车!港中文×通义TCOD方法成功率暴涨18%,训练提速32%
导语:港中文×通义提出TCOD方法,用课程学习解决多轮Agent蒸馏的稳定性难题,成功率最高提升18%,训练时间减少32%。
把大模型的能力“蒸馏”给小模型,在多轮对话Agent场景中一直是个难题。香港中文大学联合阿里通义事业群提出了一种名为TCOD(Temporal Curriculum On-Policy Distillation)的训练方法,成功解决了多轮Agent蒸馏的不稳定性问题,让小模型“死而复生”,大模型性能也大幅提升。

多轮Agent蒸馏失效的根源:轨迹级KL不稳定性
On-Policy Distillation(OPD)在单轮任务(如数学推理)上效果不错,但在ALFWorld、WebShop等多轮交互任务中却直接翻车。小模型KL散度飙升,成功率崩塌到接近0;大一点的模型虽然能收敛,但初始KL极高,训练极不稳定。团队发现根本原因在于轨迹级KL不稳定性:随着交互轮次增加,教师模型对学生生成回复中各token的概率分配持续降低,每一轮误差不断累积,将学生模型推到教师模型从未见过的状态区域,导致监督信号失效。

TCOD:课程学习从短到长,小模型“满血复活”
TCOD的核心思路很简单:不要一开始就让学生独立走完整条轨迹,而是采用课程学习,从短轨迹逐步扩展至长轨迹。团队设计了两种变体:
- F2B(前向到后向):先让学生负责前几步,再逐步接管后续步骤。
- B2F(后向到前向):先让教师引导到接近终点的状态,学生只负责最后几步,再逐渐向前延伸。


两种方式只需对现有OPD代码做极少改动,即可实现。
实验效果:成功率最高提升18%,训练时间减少32%
团队在ALFWorld(具身导航)、WebShop(电商购物)和ScienceWorld(科学推理)三个多轮Agent基准上验证了TCOD的效果:
- 小模型Qwen3-1.7B在Vanilla OPD训练后几乎崩溃(平均成功率0.17%),而TCOD将其拉升至18%以上,提升超过18个百分点。
- 以Qwen2.5-3B学生模型为例,在ALFWorld Valid Unseen测试集上,Vanilla OPD成功率为60.45%,TCOD-F2B达到79.19%,提升18.74个百分点,同时平均行动步数减少了2.97步,推理效率和任务性能同步提升。

研究人员还构建了Hard测试集(121个教师模型pass@10全部失败的任务,教师自身成功率仅6.61%),Qwen2.5-7B学生模型在TCOD-B2F训练下Hard集成功率达到20.66%,比教师高出14个百分点,表明TCOD不仅能学会教师会的,还能泛化到教师不会的任务。
训练效率方面,TCOD-F2B和B2F比Vanilla OPD减少了约32%的总训练时间,原因在于课程学习早期只走短轨迹,rollout更短、数据收集更快。此外,超参数鲁棒性验证表明,课程扩展速率η在{2,4,6}之间变动时,成功率波动不超过2%,几乎无需调参即可使用。
总结
TCOD通过“从短到长、循序渐进”的课程学习,有效解决了多轮Agent蒸馏中的KL不稳定性问题,显著提升了小模型的成功率和训练稳定性。未来,这类时序课程机制有望成为训练长程Agent的标配组件。
论文:https://arxiv.org/pdf/2604.24005
GitHub:https://github.com/kokolerk/TCOD
ModelScope:https://modelscope.cn/collections/wjqkoko/TCOD
Hugging Face:https://huggingface.co/collections/kolerk/tcod