Bengio出手打破LLM思维链瓶颈:16步并行轨迹如何干掉320步串行推理?
导语:图灵奖得主Bengio团队推出GRAM,以“宽度设计”打破自回归串行瓶颈,开启潜在空间多轨并行推理新路径。
LLM推理效率的死胡同与潜在空间的突围
在大模型技术爆发的当下,关于推理效率的讨论几乎从未停息。最习以为常的方案是链式思维(CoT)——让模型吐出更长的中间步骤,用生成的Token去码出推理过程。这种设计带来了性能提升,但伴随而来的代价同样极其沉重:推理路径拉得越长,生成的Token就越多,延迟和算力成本呈指数级攀升。这在实际工程落地中是一笔难以承受的账单。
杨立昆(Yann LeCun)在前不久的播客中指出:大语言模型的自回归Token生成并不是通往通用人工智能(AGI)的终极路径,真正高级的智能需要在潜在空间(Latent Space)里通过规划和推理来完成。话音未落,另一位图灵奖得主约书亚·本希奥(Yoshua Bengio)的团队就交出了一份颇具颠覆意味的答卷。
他们在一篇新论文中提出了名为“生成式递归推理模型”(Generative Recursive reAsoning Models,简称 GRAM)的全新范式。这项研究将以往确定性的递归潜在推理扭转为概率性的多轨迹计算。简单来说,它让模型在潜在空间中进行随机递归推理,每一步都可以采样出不同的方向,从而在广阔的解空间中进行多路径的探索。这一转向带来了极具冲击力的效率增益:在实验中,GRAM仅需16步递归结合20个并行采样,表现就轻松碾压了所有传统确定性基线在320步串行递归下的表现。
论文的基本信息非常明确,它展示了生成式递归推理的巨大潜能。以下是研究背后的深层技术逻辑与实际性能剖析。
从“单轨确定性”死胡同,到“多轨概率性”新世界
要理清 GRAM 的价值,我们必须先看清之前的递归推理模型(RRM)卡在了哪里。以往的递归推理模型通过共享参数的转移函数,在相对持久的潜在状态上进行反复迭代。这种设计的最大优势是解耦了推理深度和参数规模——只要反复跑相同的转移函数,一个身形消瘦的小模型也能做出极深度的内部推理。但这套机制有个致命的硬伤,那就是它是“确定性”的。
一旦给定了输入和初始化状态,模型就只能像火车运行在单轨铁路上一样,顺着唯一的一条潜在轨迹跑到底,最终给出唯一的预测。但这不符合现实世界中很多复杂问题的本性。比如著名的N皇后问题,或者在面对容易陷入局部最优解的复杂逻辑时,一条道走到黑的单轨计算往往会直接撞上天花板,在错误的最优解附近原地打转。

GRAM 破局的思路直戳本质:既然单条轨迹容易走偏或无法穷尽解空间,不如在每一步潜在转移的递归中,主动引入可学习的随机性。
具体实现上,GRAM 在每次迭代更新时,不是直接计算下一个状态,而是先通过确定性模块输出一个“提议更新”值。接下来,模型从一个基于当前状态的高斯分布中采样出一个“随机引导信号”。将两者融合,才得到新的潜在状态。

在这个公式里,均值控制着基于状态的迭代方向,而方差则动态调控着探索的范围大小。这使得模型既拥有深入推演的确定性,又具备跳出局部泥潭的不确定性冒险能力。为了不让这种随机性毁掉底层计算的精度,GRAM 特别设计了层次化的潜在状态结构,将状态分层:
- 低层组件(Low-level component):在每次状态转移中进行更细粒度的局部计算,通常快速迭代多次,负责繁琐的微观步骤;
- 高层组件(High-level component):只在每次大转移中更新一次,主要承载抽象的推理状态与大方向的规划决策。

研究团队将随机性仅注入高层组件中。这种设计精妙在于,随机引导只在慢速度、高抽象的决策层面起作用,负责控制路线方向,完全不会干扰到低层精细化计算的平稳性。通过训练时的变分推断(最大化证据下界 ELBO),后验分布得以“看到”正确答案,并学习在潜在空间中哪些随机引导方向能通向正确出口。推理时,模型只需根据学到的先验分布进行多路径采样探路即可。

双轴扩展:把计算预算分给“宽度”
过去,推理时计算的升级思路基本局限于“继续往下想”,即通过堆砌递归步数进行所谓的“深度扩展”。GRAM 最大的亮点在于提出了“双轴扩展”策略,不仅支持深度扩展,还极力释放了并行计算在宽度层面的威力。
所谓宽度扩展,就是在推理时从先验分布中并行生成多条完全独立的计算轨迹。大家各自寻找出路,最终各解出一个候选答案。这时候,系统通过特定机制来做大浪淘沙筛选结果:
- 多数投票法(Majority Voting):选择被多条轨迹同时验证、频率最高的候选答案;
- 潜在过程奖励模型(LPRM):通过训练一个高维值函数,在推理中途直接从潜在状态给轨迹打分,精准挑选出最有希望走向正确目标的推理线路。
在实际硬件环境中,这种“宽度扩展”带来的速度福利是十分明显的。并行采样的轨迹可以同时丢入GPU集群计算,并不增加总体的运行时间。而在原有的纯串行递归体系下,想摸索同样规模的解空间,唯一的出路是耗费数倍的串行壁钟时间去向下深挖。
极限硬核任务实测:16步并行的全面压制
这种技术革新所折射出的战斗力在真实基准测试中展现得格外明显。首先是极具挑战的结构化推理任务:Sudoku-Extreme(极限数独)与 ARC-AGI(抽象推理挑战)。
在极少给出线索的 Sudoku-Extreme 测试中,所有递归模型都在相同的 16 步迭代限制下运行。GRAM 一举卷下了 97.0% 的高解题率,相比之下,同级别确定性基线模型的表现有些惨淡,TRM 仅达 87.4%,而 HRM 更是只有 55.0% 的通过率。
如果我们关注推理时间的扩展曲线,会得到一个更有趣的结论:传统 TRM 哪怕把串行递归深度一口气调高到 320 步,准确率也才勉强磨到 90.5%;而 GRAM 在“16步深度 + 20条并行路径”的结合下,就已经飙升到了 97.0%。这清晰地证明,在相近的计算规模分配中,将算力表现在大脑运作的“宽度”与“深度”两端,远比单一在深度上钻牛角尖高效得多。
在面对存在多个有效解和强约束的多解任务时,GRAM 更是表现出了绝对的主场优势。以 8×8 N-Queens(皇后问题)和 Graph Coloring(图着色)测试为例,由于传统的确定性递归模型在给定的输入下只会返回一个固定解,面对庞大的可能解分布时,其覆盖率天然受限,最高卡在 36.1%。自回归模型(AR)虽然具有一定的生成多样性,但缺乏递归修正机制,导致约束检验的准确率极为垫底。
唯有 GRAM 将两者的好习惯结合到了一起,不仅拿到了最高的解题准确率,其生成不同有效解的覆盖度同样逼近优秀。在 Graph Coloring(图着色)中,GRAM 在8顶点和10顶点上的冲突边数仅为 2.7 和 3.3,这比自回归模型高达 19.0 和 61.3 的冲突数据要表现出优异得多的规则遵循度。
无条件生成与消融实验的深刻启示
跳出单一推理轨道,GRAM 的无条件生成本领同样令人惊讶。在无条件数独生成上,它仅拿着 10.9M 的微型参数规模、消耗 16 步迭代,就把有效数独的生成率抬升到 99.05%。要知道,大名鼎鼎的 D3PM 扩散模型要达到这个质量,需要动用高达 55.1M 的参数且耗时 1000 步去噪迭代。
而在二值化 MNIST 手写字符生成测试中,TRM 确定性基线模型由于自身极易发生的模式坍塌(Mode Collapse),拿到了 303.29 的极差 FID 评分;而 GRAM 却做出了媲美 D3PM 扩散模型的生成效果,FID 取得了 73.34 这一非常直观的提升。更让人兴奋的一点是:尽管在训练时仅仅使用了 16 步训练,但当在测试中调高潜在空间的递归步数,模型的生成质量依然能够无延迟损耗地单调改善,FID 评分从 8 步的 84.08 直线下降到 256 步时的 73.34。
团队最后细致地拆解了机制,进行了严格的消融实验。结果证明核心策略缺一不可:
- 如果拿掉“引导方向”(只保留单纯的随机扰动),数独任务虽然勉强撑住,但在 N-Queens 任务上准确率遭遇直接腰斩,暴跌至 50.27%。
- 若是拿掉“随机性”(重新回归之前的绝对确定),模型直接陷入罢工,两个任务的推理精度几乎归零。
- 如果在以往的 TRM 模型上做简单的外力改进,例如直接加入随机初始化或在解码时做随机化处理,都没办法看到任何正向收益。
这表明 GRAM 呈现出的强悍性能并不是源自任何浅表的技术调优或随机噪声,而是深深获益于其变分计算框架里——将随机探索与经训练的引导方向完美咬合在一起的深层数学设计。
它为我们构建未来的推理模型提供了一个前所未有的视界。大模型的思维广度,在这一刻得到了和深度同等重要的工程正名。不用再一遍遍逼着模型吐出冗长的推理文字,也无需忍受动辄数百步的计算延时,潜空间里多轨齐飞的生成式推理,或许就是我们摸到下一代模型架构边缘的开端。




