告别“废话连篇”的推理!浙大等提出Heima框架:大模型用3个隐式Token看懂世界
导语:浙大等提出Heima推理框架,用极少「隐藏思考」替代冗长逻辑文本,让大模型推理速度飙升。
慢条斯理的“内心戏”,正在拖垮大模型
对于当下的AI行业而言,思维链(Chain of Thought,简称CoT)几乎称得上是一剂让大模型重获新生的灵丹妙药。通过让模型在回答前一步一步“写出”中间的心路历程,无论是逻辑推理还是复杂的数学计算,AI的正确率都得到了跃升。然而,这背后却隐藏着一个昂贵的代价,那就是漫长得令人近乎崩溃的推理时间。
大模型要想输出最后的答案,就必须先老老实实地生成上百个、甚至上千个代表中间过程的显式文本Token。每一次自回归解码所产生的硬件延迟和显存负荷,都在吞噬着计算资源。对于同时接入图像和文字的“多模态大模型(MLLMs)”来说,情况则更为严峻。为了回答一个简单的问题,模型往往要先用大段累赘的辞藻描述画面结构、剔除杂讯、分析视觉逻辑,再顺着思路慢吞吞地给出最后的答案。
于是,一个非常本质、也非常具有启发性的疑问摆在了研究者面前:大模型进行深度思考,难不成真的一定要把它写成人类能读懂的中文或英文吗?模型自己的“脑回路”里,能不能有一套更隐秘、更高效率的符号体系?
由浙江大学、Adobe Research、杜克大学等研究机构组成的联合团队,在一篇名为《Efficient Reasoning with Hidden Thinking》的论文中做出了颠覆传统的探索。这篇已被AI顶级学术会议 ICML 2026 接收的工作,提出了全新的多模态高效推理框架——Heima(黑马)。该工作的核心思想,就是把原本冗长刺眼的长文本推理过程,高度压缩进极少数抽象的特殊“思考Token(thinking tokens)”中。
该论文已被学术会议正式采纳,开源代码也已在 GitHub 上释出(https://github.com/shawnricecake/Heima)。论文的第一作者沈轩,作为浙江大学“百人计划”的研究员,其长期的研究阵地正是如何让模型在各类边缘硬件、GPU 及专用集成电路(ASIC)上以极高的吞吐率完成推理加速。这次的研究,正是他从系统和算法双重瓶颈入手的一次绝妙反击。

Heima框架:将漫长的草稿压缩进隐式Token
为了直观理解Heima究竟做了什么,我们可以举个生活中的例子。当一个人解答复杂的几何难题时,脑海里划过的可能只是一瞬间的几个关键连接点、图形对称性或某种直觉符号(比如“辅助线”、“相似形”),并不需要在纸上完全默写一遍详细的定理陈述,才能够推导出答案。而传统大模型,却在像抄书一样机械地把每一条思考痕迹打印出来。
Heima在架构上的突破点,就是构建了一套“隐式思维链”。它并没有完全消灭思考这一步,而是设计了三个极为精准的核心机制。
替换冗长文本以缩减开销
在原本的视觉问答中,给定一张汽车图片,模型如果想认出品牌并解释缘由,就必须吐出冗长的独白:
“图中心位置有一辆酷炫的黑色轿车,其双肾型格栅展现了典型的运动风格,中间带有标志性方向盘样式的蓝白车标……”
这大段略显累赘的描述在Heima的世界里被彻底改写。整个推理过程在对人类不可见的隐空间里悄然完成,模型不需要呈现任何汉字,而是直接转化成了三个特制的隐空间占位符,包含了对图像特征提取、逻辑梳理以及最终推断的抽象代表:<Thinking_of_Summary>、<Thinking_of_Caption>以及<Thinking_of_Reasoning>。
这几个Token在显卡里只占用了极少的计算步骤,但它们的隐藏状态中却已经被高度浓缩了关于车标特征、车身轮廓、逻辑关联的大量信息。对于大模型来说,这些抽象向量本身就已经具备了推演未来的能力。
步步逼近的隐空间压缩与“解密”翻译官
然而,直接命令模型把一整段逻辑从最开始的一万字生硬地捏成三个Token,模型必然要在信息的汪洋大海里丢失方向,导致预测能力大幅受损。论文的核心精妙之处,就在于引入了“渐进式蒸馏(Progressive Distillation)”的巧妙训练手法。
在训练阶段,联合团队并没有采用全盘一刀切的极端激进手段。相反,他们引导模型从最后一个阶段开始,逐步试探性地把推理片段替换为隐式Token,通过小步快跑的循环微调形式,让模型习惯于用局部的神经元激活序列去承载大量的显式表征。这一平滑过渡,构成了整个隐空间推理强韧精度的技术底气。
此外,面对这样精简的隐空间隐式推理,很多人心中难免生出一个疑问:既然模型都在“打暗号”,人类又怎么可能得知它是不是真的在理性决策,抑或只是一场精心伪装的蒙混过关?为了消除这种隐藏黑箱带来的疑虑,研究人员构建了一个极其有意思的“自适应解释器(Adaptive Interpreter)”。
这其实是一个完全基于传统纯语言模型的微调分支,它既没有直接触碰原始图像输入,也不参与Heima对主任务的真正运算。这个解释器接管的,仅仅是那些Heima运转出的、带有浓厚思考印记的思考Token隐藏状态。它的任务,是把这些被压缩的黑箱向量重新“反编译”为人类看得懂的清晰语言段落。
测试结果非常令人惊喜:即使失去了原始图像信息,解释器依然能够仅仅通过这几颗隐藏的思考Token,百分百还原出关于汽车外观细节和推导品牌的逻辑线路。这也充分印证了模型的隐空间思考并不是故弄玄虚的空中楼阁,而是实实在在凝聚着高度保真的逻辑脉络。
用信息论给“隐藏思考”做个硬核自检
为了自圆其说并给予同行严密的学术证明,该研究还顺理成章地用客观的信息论逻辑,对这场“高压缩率”的推理降损做了深度的公式拆解。

数据处理不等式的存在揭示了一个无法规避的真理:压缩过程必然伴随着非零的信息耗损。原始思考链与高度精简的隐式Token之间,终归会拉开一小段信息差距。其间的数学逻辑可以用互信息关系表示:

既然信息在流转中必然会面对边际递减的客观事实,我们如何确信隐式Token还能完美留存推理线索?研究团队给出的论断是,只要压缩后的Token与答案预测路径之间保留了极富价值的非平凡互信息,推理精确度就绝不会发生崩塌。借助巧妙的系统调优,Heima最大程度地拉低了这两者之间的信息空隙,促成模型在几乎“隐身”了多行长文的极端状态下,逻辑纯度仍能不落下风。
极速计算下的性能无损,AI推理走向效率深水区
在各大主流多模态大型评测基准上的大考进一步给出了扎实的证据。Heima在数个极具挑战的测试集合中均以优异成绩通关——其生成Token的整体数目被成倍抹去,省下了一大块宝贵的自回归计算耗时,但得出最终答案的准确率依然紧咬原版的长链显式文字推理。极其有趣的是,在处理由于长篇长句自我串联极易引发的视觉幻觉和语言幻觉时,Heima隐式推算的效果反而显得更加利落而敏捷。
这无疑打破了某种沿袭许久的潜规则,并由此带来一个打破定式的启示:人类的自然语言,难道真的是计算网络唯一的“原生态”思考介质吗?
我们人类受制于生理特性的局限,终其一生都在使用高阻抗、线性低吞吐的符号序列作为思维介质;可由天文数字级别矩阵层叠交织出的AI神经网络,直接在多维潜空间中进行近乎光电跃迁式的向量推理,或许才更符合它那永不沉睡的高阶思维特性。将人类用以交流的显式自然语言,硬性塞给作为复杂算力体的大模型,很多时候反而像是在给赛车套上繁重的铁链。
在这一天平的另一端,当多模态能力大跨步沉淀至微型的边缘硬核设备、各种紧凑的车机中继站、乃至于时延极紧凑的具身机器人系统中,毫秒级别的时延退让和内存瓶颈都决定着产业级规模化应用的命运。Heima的探索成功指明了极其明确的前景:原来,通算力更上一层楼的秘密逻辑并不用指望硬件的不断堆料,大模型在静默思考中本就拥有无限潜力,而我们要做的,就是主动解放它们那一本正经演废话的长嘴,去探寻更广阔的隐空之海。


