多跳推理性能飙升20%!Search-R2将纠错纳入策略空间,破解搜索增强推理的长链信用分配难题

导语:Search-R2框架将纠错行为纳入强化学习策略,让模型学会在长链推理中定位并修复错误,多跳推理性能最高提升超20%。

大语言模型的推理能力正在经历一次静默的转变——从“让模型一次答对”到“允许模型在推理过程中犯错并自我修正”。近日,由MBZUAI、香港中文大学和腾讯混元团队联合提出的Search-R2框架,正是这一趋势下的关键突破。这项研究直面搜索增强推理中的两大顽疾:长链推理中的信用分配困难,以及缺乏有效的中途纠错机制。通过将纠错行为本身纳入强化学习的策略空间,Search-R2让模型学会了在推理中途定位并修复错误,从而在需要多轮搜索的复杂任务上取得了惊人提升,在Bamboogle数据集上相对基线准确率提升超过20%。

问题本质:长链推理中的“错误传播”为何难以解决?

在开放环境中进行多轮搜索与推理已经成为智能体的主流工作方式。然而,一个隐蔽但致命的缺陷始终存在:搜索结果不可避免地含有噪声,一旦早期某次检索或信息采信出现偏差,后续推理就会在错误的语义空间中不断自洽,最终生成看似合理却完全偏离问题的答案。这种“错误传播”现象在多跳推理任务中尤为突出,因为多跳推理往往需要模型进行“搜索—推理—再搜索”的多次循环,中间任何一步的失误都会被后续步骤不断放大。

现有的训练方法难以应对这一问题。传统的强化学习(RL)通常只依据最终答案是否正确来给予奖励,这导致“偶然蒙对”的轨迹和“搜索路径合理”的轨迹得到完全相同的正向反馈。长此以往,模型学到的不是“如何搜索得更好”,而是“只要最后能拼出答案就行”。这解释了为何许多搜索增强模型在面对复杂多跳问题时会出现系统性的性能崩溃。

Search-R2的核心设计:将纠错本身变成可学习的策略

Search-R2框架的创新之处在于,它不再将纠错视为一个僵化的、依赖人工提示的后处理步骤,而是将其纳入模型的策略空间,通过强化学习让模型主动学习“何时纠错”以及“如何纠错”。整个框架由三个协同工作的模块构成:

  • 推理生成模块(Actor):负责生成完整的包含搜索与推理行为的轨迹。这个模块被允许犯错甚至进行探索,不承担中途自检的职责。
  • 纠错模块(Refiner):首先判断整条推理轨迹是否偏离原始问题(如出现实体偏移、主题漂移等)。若判定需要修复,则进一步定位第一次实质性偏离的位置,保留此前正确的推理前缀,从偏离点重新生成后续内容。这一设计确保了训练信号能够精确回传至错误首次发生的步骤,从而“惩罚”真正的错误根源。
  • 过程奖励信号:为强化搜索质量,框架还引入了衡量检索信息密度的过程奖励,用于区分高低质量的搜索行为。该奖励仅在最终答案正确时才生效,避免了模型单纯堆砌搜索操作而不提升信息质量。

这三个模块共享同一套模型参数,并在统一的强化学习目标下进行联合优化。这意味着“是否触发纠错”和“在何处纠错”被视作和“生成下一个token”一样的策略决策,模型在训练中会逐渐内化出一套高效的纠错行为模式。即使不显式触发多次修复,训练后模型的初始推理路径质量也会显著提高。

实验结果:多跳推理能力跨越式提升,样本效率碾压拒绝采样

研究团队在普通事实型问答(单轮搜索即可完成)和多跳推理问答(需多轮搜索协同)两大类任务上进行了评测。结果显示,Search-R2在两类任务上均取得稳定提升,但在多跳推理任务上的增益尤为显著。在HotpotQA、2WikiMultiHopQA和Bamboogle等经典数据集上,准确率提升幅度从数个百分点到十余个百分点不等。其中在Bamboogle数据集上,相对基线方法的提升幅度超过二十个百分点。这充分说明,方法的核心价值在于抑制长链推理中的错误传播,而非单纯增强模型的参数记忆。

在与拒绝采样策略的对比中,Search-R2展现出更高的样本效率。即便将基线方法的采样预算提升至原来的两倍甚至更多,其性能仍低于Search-R2在较小采样预算下的结果。原因在于,拒绝采样在生成失败后会直接丢弃整条轨迹并重试,而Search-R2认为失败轨迹的前半部分往往仍具有价值,只需定位并修复导致失败的那一次搜索操作即可。这种“精准干预”在长链任务中带来了样本效率的量级差异。

消融实验进一步揭示了各个模块的贡献。仅引入中途纠错机制(而不加入过程奖励)已能带来显著提升,表明错误定位与修复是解决搜索增强推理瓶颈的关键。当加入过程奖励后,性能进一步提高,说明显式区分搜索质量能为训练提供更稳定的优化方向。最终,在生成模块与纠错模块联合优化的完整设置下,模型在所有数据集上达到最优,证明纠错能力并非静态规则,而是可以通过训练逐步学习和内化的行为策略。

理论支撑:信用分配难题的形式化解构

从强化学习的视角看,Search-R2解决的是长链决策中长期存在的信用分配难题。在搜索增强推理中,模型需连续做出“是否搜索”“搜索什么”“何时搜索”以及“是否信任检索结果”等多尺度决策,传统“仅看最终答案”的反馈无法区分这些中间决策的质量。研究团队将问题形式化为:只有当模型能区分哪些轨迹值得保留、能准确定位导致推理偏离的错误位置,并且训练中触发适度纠错时,性能才能稳定提升。这一结论并非经验归纳,而是通过形式化分析给出的必要条件。这为后续研究提供了坚实的理论基础。

研究者团队简介

该论文的第一作者Bo wei He目前是MBZUAI机器学习系的博士后研究员,合作导师为刘学教授。他此前于香港城市大学获得博士学位,研究方向涵盖数据挖掘、语言模型、科学AI及智能体等,近期重点关注智能体强化学习、记忆、长时程演化等前沿课题。共同第一作者Minda Hu是香港中文大学计算机科学与工程系的博士研究生,导师为金国庆教授,研究方向聚焦于数据挖掘、机器学习与自然语言处理的交叉领域,当前致力于探索更高效利用大语言模型以提升推理能力。此外,该工作还得到了麦吉尔大学、香港城市大学和爱丁堡大学等多位研究者的参与和贡献。

论文地址:https://arxiv.org/pdf/2602.03647

© 版权声明

相关文章