ICLR 2026 Oral重磅:大模型“想太多”有解!DECS让推理Token砍半,准确率反升2.5%
导语:ICLR 2026 Oral论文DECS从理论揭示长度惩罚缺陷,提出解耦奖励与课程调度,实现推理减半且性能提升。
大型推理模型如DeepSeek-R1、OpenAI GPT Thinking虽然凭借数千token的思维链在复杂推理任务中表现出色,但一个普遍问题日益凸显:过度思考(overthinking)。模型在得出正确答案后,仍反复出现“wait…”“let me check…”“alternatively…”等自我修正表述,导致大量无意义的计算开销。

来自复旦大学、上海交通大学和上海人工智能实验室的研究团队(一作江书洋,师从上海交通大学王钰教授和张娅教授)在ICLR 2026 Oral论文中,首次从理论层面揭示了“长度惩罚”策略的根本局限,并提出了全新框架DECS。实验表明:在五项域内基准和两项域外基准上,DECS将推理长度减少超50%,同时模型准确率不降反升。

论文地址:https://openreview.net/forum?id=kdeiRledV6
项目地址:https://pixas.github.io/decs-iclr26-site/
长度惩罚为何总是“误伤好人”?
研究团队对主流强化学习框架(如GRPO)中的序列长度惩罚机制展开理论分析,揭示了两个致命缺陷:
缺陷一:对高熵探索Token的无差别攻击
模型推理中生成的“wait”“however”“alternatively”等高熵token,本质上是逻辑衔接的“状态转移”,属于必要的探索行为。但序列级长度惩罚不区分token类型,导致正确长推理链上的所有token均匀接收负面梯度。当训练数据中简单题占多数且长度差异大时,这种压制会累积,使模型丧失探索能力,过早收敛到次优策略。
缺陷二:对局部冗余的“变相奖励”
团队引入关键概念——必要推理前缀(Necessary Reasoning Prefix, NRP),即从推理开始到首次得出正确答案所需的最短token序列。NRP之后的所有token均为冗余。然而现有序列级奖励机制中,一条包含NRP的较短回答,其冗余token仍可能因整体组内较短而获得正奖励。这种“奖励冗余”信号扭曲了优化方向,让模型学不会在该停时停下。

图1:序列长度惩罚的两个副作用
DECS:一次“解耦”如何根治过度思考
基于上述发现,DECS从两个维度重构训练过程:
第一步:解耦Token级奖励,精准识别并惩罚冗余
团队训练轻量级NRP检测器(judge model),定位推理链中从起始到第一个包含正确答案的“块”之间的所有token。确定NRP边界后,DECS对奖励函数“解耦”:NRP内的必要推理token永远不受惩罚;NRP之后的每个冗余推理token恒定负奖励。这确保了模型只被禁止“画蛇添足”,而不影响通过反思和多样化推理得到正确答案。
第二步:课程式批次调度,保护探索能力
直接惩罚冗余可能误伤看似冗余实则探索的高熵Token。DECS动态调整训练batch中简单题的比例:当模型当前平均NRP占比较低(冗余较多)时,少放简单题;随着冗余减少,逐渐提高简单题比重。这种缓冲机制在压缩冗余的同时,给模型留出探索空间。

图2:DECS训练示意图
实验验证:多个数据集推理长度砍半,性能反升
实验覆盖DeepSeek-R1-Distill-1.5B、7B以及Qwen3-4B三个基座模型,在AIME2024/2025、MATH500、GPQA-Diamond、LiveCodeBench-v6等七个基准上评估。结果:
- 1.5B模型:平均推理token削减57.17%,Pass@1准确率提升2.48个百分点。
- 7B模型:减少49.50%的思考token,准确率提升0.8个百分点。
- 与ThinkPrune、TLMRE、LC-R1等基线相比,DECS在效率-性能综合指标(AES score)上分别以0.12和0.14的优势领先。
更重要的是跨域泛化能力:NRP检测器仅用数学语料训练,其效率优势却迁移到科学推理(GPQA-Diamond,56.33% token缩减)和编程任务(LiveCodeBench-v6,33.52% token缩减)上。这验证了过度思考是跨领域系统性现象,DECS的机制足够本质。

表1:DECS性能对比
消融实验证实了两个组件的互补关系:去掉课程调度,性能显著退化;单独去掉解耦奖励,模型仍残留约25%冗余Token。
DECS的核心价值在于其所提问题与理论证明:当前业界聚焦于“如何让模型更善于思考”,却鲜有回答“什么不值得思考?”及“何时应当停止思考?”。DECS证明高效推理的瓶颈在于训练目标的精妙设计,而非模型能力边界。该技术已开源,为受困于推理大模型成本与延迟的部署者提供无需牺牲精度的方案。