砍掉93%无效计算!清华等提出TaH架构,治好了小模型的“钻牛角尖”旧疾

导语:清华等联合研发TaH机制,精准砍掉93%无用思考,让端侧小模型推理性能狂飙!

当大模型陷入“深度思考”的算力陷阱

在推理性能狂飙的当下,从引路行业前沿的 OpenAI o1 到近期备受瞩目的 DeepSeek-R1,“让模型多想一会儿”似乎成了通往强逻辑推理的标准方案。拉长思维链、堆砌测试时计算,这些手段确实攻克了许多高难度的逻辑硬骨头。

然而在此背景下,一个根本性问题却鲜少有人公开探讨:模型真的有必要对输出的每一个字、每一个标点符号都“抓耳挠腮”地深度思考吗?

在实际的推理生成过程中,并非所有 Token 都具有相同的逻辑权重。如果让模型在应对极简单的基础词汇时也被动进入多轮迭代的深层推理,非但极大地白白损耗了算力,甚至可能适得其反——模型在第一次直觉反应时原本得到了正确答案,非要反复纠结反而自己改错了。这种反效果在学术界与工业界正显现其破坏力。

为了攻防这一痛点,清华大学电子系 NICS-EFC 实验室(联合第一作者为直博生傅天予与本科生尤忆晨)、无问芯穹以及上海交通大学的联合研究团队,交出了一份精妙的答卷:Think-at-Hard(TaH)选择性潜空间迭代机制。这项不仅入选了 ICLR LIT Workshop 的 Best Paper Shortlist,更被国际机器学习顶级会议 ICML 2026 正式接收。它带来了一个颠覆性的视角,即只在“最艰难的节点上驻足”。

被忽视的痛点:潜空间过度思考

要说清 TaH 的破局之处,我们需要将视线移向致力于让端侧硬件爆发更高心智的优化模式——Looped Transformer

对于在资源受限设备上运行的小型模型(如 0.6B、1.7B 或 4B 参数规模的模型)来说,它们往往会因为思维路径上的少数关键错漏而导致整道数学题或代码任务功亏一篑。为了榨取极限能力,业界尝试将最后一层的隐状态反复送回模型前序层作“二次回炉”(即潜空间迭代)。这种方法精明地在不额外扩充模型身量的前提下升级了计算深度。

但清华与无问芯穹团队在详实的分析中发现了另一层隐忧:潜空间的反复拉扯其实很容易造成两极分化。在修正错误前哨词的同时,很多本来就一次预测准确的选择,反而会在反复被动思考里被计算噪音带偏。团队深刻地将其命名为潜空间过度思考(Latent Overthinking)

研究揭示出的内核极富哲学意味:并非算力给得越满成绩越好,盲目把算力泼洒在平凡无奇的垫脚石 Token 上,换来的只是逻辑推理偏离正常轮廓与无谓的时延负荷。

上帝视角的猜想:只在卡壳时思索能赚多少?

探索极限的路上,团队设计了一个概念化的上帝视角模型(Oracle Strategy):仅有模型初次前向传导出错时,才触发后续的迭代深入思考;如果直觉就已经答对,就立刻放行输出。实验跑通的那一刻,反馈的数字非常惊人:

  • 小动干戈换巨幅提升:仅仅只让约 11%–19% 比例的关键卡壳字句进入二次精修迭代,原本简单的字句迅速放行,模型的下游基准跑分便拿到了 7.3% 的净增幅。
  • 优化架构的惊人突破:如果在这个选择性迭代框架中融入 TaH 最优的专属架构设计,这部分逻辑纠偏所撬动的算力红利甚至直接推高了 25% 以上的极限精度。

实验证明了一个真理:大模型逻辑思考的蜕变,根本不需要平铺直叙地去拉长每一个字符的运算路径。它真正需要的,是一双能够在“关隘转折点”紧急调配算力的眼睛。

TaH 的精巧解法:三大机制构建的高效铁三角

在没有完美预测对错的真实对话场景下,如何自适应且极其精准地筛出那些真正困难的字句?TaH 架构并不是强塞更多玄奥冗余的理论,而是靠下面这套落地性极佳的“微创手术级”架构设计。

清华TaH框架跳过93%无效迭代!大模型推理性能深度优化

一、轻巧敏捷的“迭代裁决器”(Iteration Decider)

团队在经典主干网络下潜藏进了一个体积纤薄的 MLP 片段。这个小小的裁决器紧盯着中后层隐状态发出的特征信号,在极短微秒内评判出当前 Token 的产生是否遭遇阻碍,并输出一个“需继续迭代”的概率倾向。一旦此倾向未达临界阈值,模型利落出牌把结果抛至下一位;反之才会扣留回炉。

这一敏锐的刹车设计直接让 TaH 的平均 Token 迭代次数锐减到了仅 1.07 次——高达 93% 的冗余计算步骤在动态掌控中被干净地清退掉了。

二、Duo-causal Attention:跳出单维格局的注意网络

一旦允许各个位置的字符按难易程度产生深度各不相同的回炉动作,整体推理流便在大跨步的逻辑迭代下,从一维的普通走势拓宽为一个斑驳陆离的“位置 × 深度”二维立体网格。传统的顺序注意力通道往往无法处理深浅并行的混编参数。

为此,TaH 机制将自回归里的因果注意力直接在“因果-深度”二维面上铺开。当第 i 个 Token 进入第 d 层的迭代考量时,它的 query 可以有选择地吸收历史路径上所有经历了不超过 d 次迭代处理的 key 与 value。此变动在彻底疏通跨越纵横两轴的信息纠缠的同阶段,近乎完美地规避了漏题风险,并稳稳托住了底座网络训练期纯异步高并行的硬性效率需求。

清华TaH框架跳过93%无效迭代!大模型推理性能深度优化

三、职能解耦的 Depth-aware LoRA 机制与两阶段训练

为了让不同周期的潜空间各负其责,团队提炼出一个简明的思想路线:初次推理本质上是做通用的语言预测,而第二遍以及随后的深探行为纯粹是为了针对难点问题进行自我订正。因此,TaH 并未采用在整个流转生命期均吃重开支的做法,而仅仅在二次以上的深度空间里配置 LoRA 适配器,使其心无旁骛地打磨纠错定向。结合残差机制,让它在前序思索的余音里针对性修复,而不是在空地上盖房子。

另外,考虑到动态裁决器的运作在初期的反馈循环由于同底层网络的权重升级深度纠错,极其容易引发互相撕咬拉扯、导致训练坍塌的危险,团队祭出了巧妙地“两阶段训练策略”:首先,依靠静态高准确策略为底座打好应对棘手错误的抗体能力;第二步锁死大模型的硬骨架,去针对性调试解耦后的裁决器,让其具备精湛地分辨时机能力。实机表现印证了这种手法不仅能闪电般收敛,稳定性也无懈可击。

清华TaH框架跳过93%无效迭代!大模型推理性能深度优化

实测斩获:用更轻的消耗,赢下更多高阶挑战

这套自适应裁剪架构的实战能量到底怎样?研究团队并没有含糊,拿来完全开源的 Open-R1 数据在极其严格且丰富的基准模型上(包括 Qwen3-0.6B、1.7B 以及 4B 在内)直接展开长盘实战。

评测版图不仅严厉覆盖了像 GSM8K 这类数学靶场,更吸纳了 OlympiadBench、AIME25 甚至高门槛的 GPQA-Diamond 尖端推理套件,以及涉及代码评估的 HumanEval++ 与 MBPP++。结果证实这一思路极具穿透力:

在完全不增加模型参数体积(保持主干尺寸不变)的条件下,TaH 对比传统 Qwen3 基线不仅没有退步,反倒稳稳换得了 3.0% 至 3.8% 的胜率跃升;更胜一筹的是,只要为 TaH 配备不超过 3% 辅助计算消耗的 TaH+ 强化版方案,这一提升区间迅速拓宽到了极其亮眼的 5.3% – 6.2%。相较于同类前沿的 Looped Transformer 选择器(如 Ouro),TaH 以及 TaH+ 分别打穿了 3.8%-4.4% 与 6.1%-6.8% 的断代统治性优势。

更为关键的是算力表现的可持续性。在极客们最为在乎的本地显卡压载测试中,TaH 让文本解码速度实现了最高达 2.48 倍的实质化爆发,显存占用相对无选择性的“一根筋硬算”方案(AlwaysThink)更是狂省了 1.48 倍。这意味着,本来在微终端设备(如主流移动手机)上因过度繁杂而惨遭硬件卡死的各类智能助手程序,由此拿到了一条能够兼顾极速生成和精准推导的通盘升级道路。

让 AI 的算力也学懂“用在刀刃上”

除却令人瞩目的量化效率以外,在后期的统计洞察中,作者分享了一个十分妙趣横溢的技术发现:TaH 大模型在训练定型后,对哪些语言节点需要追加精力甚至衍生出了极高仿生学智慧的动作倾向。

在测试库的统计追踪里,“But(但是)” 与 “So(所以)” 竟然是所有词网结构最容易直接引起模型内部红灯触发额外潜空间思考的头号信徒。But 的额外潜迭代触发率拿到了 34% 的惊人高位,So 也跟着拿下了 18% 分支占比。

只要是写过文字或者解密过复杂代数的人一定会自得一笑:人类脑筋在思考问题的时候,最容易卡壳或者一不留心就搞出逻辑大拐弯甚至推理崩塌的地方,这不正巧就发生在发生逆转、发生因果勾连的语境命题转换的十字路口吗?TaH 用代码让大模型用底层神经学会了,在哪里犹豫不决,就在哪里凝神屏气。

长久以来,将大模型推向更复杂测试时计算的途径中,大众似乎逐渐习惯了默认接受为了极限性能就必须粗放低效地无限拖慢思考步伐这一弊政。而清华与无问芯穹交出的这项工作,则用一柄极为精湛的手术刀将计算思考精细剥离至 Token 级别。这不仅让我们目睹了端侧小模型以克制和精明打破算力瓶颈以小搏大的卓越风姿,也更令人期待当人工智能深入生活的每个缝隙,这种懂得收敛与在关键处爆发的内敛心智,将如何勾勒真正敏捷、亲和的交互未来。

清华TaH框架跳过93%无效迭代!大模型推理性能深度优化

清华TaH框架跳过93%无效迭代!大模型推理性能深度优化

© 版权声明

相关文章