让推理大模型“边想边说”!ICML 2026论文揭秘如何用SxS交错推理打破空转尴尬
导语:推理模型的“沉默税”该怎么解?这篇ICML 2026力作提出了让模型学会“边想边说”的新路径。
在漫长的等待里,推理模型收了我们多少“沉默税”?
经常使用 o1、Claude 思维链模式或类似推理型大模型的朋友,对这种场景肯定不陌生:当你输入一个复杂的数学题或代码改错,屏幕便陷入死水一般的寂静。模型在后台疯狂运转,前端却长达数十秒没有任何有用内容吐出。如果为了用户体验,强行让模型立刻向外输出,它又极其容易在开局就做出仓促判断,导致后面的推理被早期的错误前缀死死拽住,一路滑向逻辑陷阱。
这正是纽约州立大学石溪分校、浙江大学、威廉玛丽学院、UIUC、UBC、香港中文大学以及复旦大学的联合研究团队试图攻克的用户交互痛点。在他们发表于 ICML 2026 的最新论文中,作者将这种传统单一自回归逻辑下的局限,形象地命名为“沉默税”(silence tax)。传统的单流生成硬性地把模型的“思考步骤”和“内容输出”绑在了一起:模型每做一次状态更新,就形成了一个公开且不可收回的回答承诺。这就造成了模型多想一步、用户就要多等一秒的对立状况。

针对这个两难问题,研究团队给出了一种颇具启发性的解法:并列式交错推理(Side-by-Side Interleaved Reasoning,简称 SxS)。简单来说,它让模型在同一个自回归上下文中学会了“看准时机再说话”。模型可以自行决策当前是继续闷头推理,还是吐出已经被推理结果有力支持的有效答案片段。这使得流式生成不再只是前端界面的视觉欺骗,而是演变成了大模型自身的自主交互策略。
解耦首Token延迟:为什么“快点开口”是一场工程误区?
为了提升交互体验,许多团队曾把精力放在极致压缩首字延迟(TTFT)上。但随着推理需求的加深,盲目追求系统的响应耗时正在失去意义。在复杂的科学计算和代码探索任务里,“快点说”往往意味着“胡乱说”。
为什么这种硬性耦合是错误的?研究团队指出,自回归生成机制在此时承担了双重角色:不仅代表模型状态的演进,更是输出内容的不可逆表态。一旦模型在思考尚未成熟时吐出了错误的前缀,它就必须被迫在一个残缺的上下文里继续推导。这就像解题时随手写下的第一个草率定义,后续的所有步骤都成了为这个错误强行辩护的过程。

SxS 交互设计的核心洞察在于,真正决定用户体验的,是内容延迟(Content Latency)而非系统级的 Token 延迟。也就是第一个跟答案密切关联、有依据的干货信息何时呈现,以及两次有意义的信息更新之间,用户到底需要悬空等待多长时间。为此,论文引入了更能体现人机感知的指标,比如平均响应间等待指标(AIRW)。
双动作流机制:想与说在同一上下文下的无缝融合
SxS 的实现思路摒弃了冗余的复杂性。它没有诉诸外挂检测模型,没有分裂多套隐藏状态,也未改变自回归大模型的主体结构。实现的关键,只在于在生成流中嵌入了两种极轻量级的特殊标签动作:
- think(内部思考):执行模型的中间推理步骤,这部分内容被保存在上下文缓存中,但不会向用户界面展露。
- speak(信息披露):把已经有底层推理依据支持的阶段性答案吐给用户。
这种可控可见性的设计,让模型能在同一个上下文中进行自恰的叙事。即使部分推理步骤被隐藏,后面的输出依然能够调用之前的思考记忆。模型不再需要在长久空转与仓促出错之间被动妥协,而是有能力一边在后台进行长程推理,一边把已经被确认的事实片段以极高的频次推送给用户。

三阶段破冰训练:从规则对齐到强化学习找回准确率
训练出这种“该开口时才开口”的习惯不能只靠直觉。纯粹的格式约束极易瓦解模型原本的推理质量。研究人员开发了一套三阶段训练流程:
第一步:构建蕴含对齐的交错轨迹
为了让模型明白在什么时候才可以有底气地说,训练首先需要生成高质量的动作轨迹。研究团队以“提示词-推理过程-最终回复”三元组为基底,拆分推导链条。随后,利用专门的蘊含检验机制,评估答案的每个片段是否被当前的推理证明。凡是得到论据支撑的段落,才被标定为“speak”动作,以此生成可供学习的示例数据。
第二步:注入双动作语义的监督微调(SFT)
在获得了对齐轨迹后,模型需要通过 SFT 学会“think”与“speak”这套交错格式的底层逻辑。在这一阶段,模型的主要功课是理解语法结构,以及在逻辑框架中何时执行动作切换。
第三步:利用 GRPO 强化学习唤醒强逻辑
因为交错格式实质上改变了模型的采样几率分布,通常在 SFT 阶段结束后,模型的答案准确性会出现掉队现象。为了把推理精度拉回第一梯队,本项研究引入了 GRPO 重塑强化阶段。利用最终答案正确与否的反馈作为主要奖励信号,这保证了模型在保持恰当信息披露频率的同时,依然不丢掉优秀的推理直觉。
Qwen3 实测印证:更紧凑的等待与更好的性能平衡
为了检验这一交互范式的成效,研究团队在 MoE 架构的 Qwen3-30B-A3B 以及密集架构的 Qwen3-4B 上开展了实验,评测集主要选用了极考验推理深度的 AIME25(数学推理)和 GPQA-Diamond(科学问答)。
数据结果给出了鲜明的例证。在 Qwen3-4B 的测试中,SxS 强化后的模型展现出了极强的效能释放:在 AIME25 榜单上,SxS RL Final 的准确率达到了 80.0%,对比标准链式推理 RL 方案的 73.8% 有了明显的跨越;而测量用户空窗等待时长的 AIRW 指标则从 21,316 直接腰斩降至 8,519。

同样的趋势也在科学问答 GPQA-Diamond 任务中显现:SxS RL Final 准确率冲到了 49.3%(标准 CoT RL 仅为 19.0%),而 AIRW 也被大大压缩。实验数据证实,并列交错推理并不是生硬地将最后答案提前,或是依靠吐出无意义的寒暄应答来缩减体感延迟,而是实质性地改造了模型在推理运转中的披露节奏,兼顾了任务准确度和流畅性的最优解。
从工程实现看“边想边说”的局限和改进空间
尽管 SxS 在控制等待空窗上表现出彩,但将其视作彻底终结推理等待的银弹还为时尚早。在真实的产研落地上,开发者仍面临几层客观挑战:
首先,研究中测算的内容延迟使用的是 Token 数量这一代理维度,它忽略了复杂的并发状态、底层框架调度、通信耗时以及前端重载对实际物理时间的影响。其次,SFT 步骤导致的推理能力受损,意味着团队必须依赖强化学习(RL)阶段的多轨对齐,这会直接拉高模型调优的时间与硬件算力成本。此外,信息披露的粒度控制也是一门微妙的艺术:追求过度高频的披露可能会引入计算开销的过载,而披露过慢又会让方案退化为原生的 CoT 逻辑。
不过,将人机交互逻辑写入大模型自带的学习策略中,这为未来的推理系统提供了一条极具操作价值的升级路径。大模型的思考可以很深,但呈现给用户的步伐,大可以踩得更加稳健而科学。
