告别漫长等待!英伟达祭出首个“三合一”大模型,吞吐量暴涨4倍,长文本秒级生成时代来了
导语:英伟达推出三模式大模型,完美融合自回归与扩散机制,吞吐量飙升4倍,开启长文本秒级时代。
不管是写长篇报告,还是让AI分析几十万字的项目文档,每次看着屏幕上一个个往外蹦的字符,你是不是也常常觉得有些慢性子?这种“挤牙膏”式的生成速度,本质上受制于大语言模型底层最经典、也最难以逾越的障碍:自回归解码(Autoregressive, AR)机制。
不过就在最近,英伟达发布了一项足以改变游戏规则的重磅研究。他们推出了全球首个三模式大语言模型(Tri-mode Language Model)系列,将三种完全不同的解码模式天衣无缝地装进了同一个模型体内。只需简单修改注意力掩码,就能在自回归、扩散以及自推测解码之间丝滑切换。
最让人兴奋的是,整个方案不需要额外的草稿模型,不变更任何底层架构,在最快模式下的Token吞吐量直接飙升了整整4倍。

为什么大模型生成老是“慢吞吞”的?
想弄清楚英伟达这次的底牌,我们得先揭开传统大模型速度受限的“遮羞布”。
在传统的自回归解码模式下,AI每次生成一个字,都要从头到尾扫一遍上下文。当我们在个人设备上发起低并发单用户请求时,这种模式极度受限于内存带宽。因为GPU需要把庞大的权重参数从高带宽内存(HBM)反复搬运到SRAM里。算力在那里空转,带宽却成了死胡同。这直接导致个人AI助手在交互时,速度总是顶不到硬件理论的上限。
有人说,用扩散模型(Diffusion Model)搞非自回归并行生成不行吗?理论上可行,但因为扩散模型训练时是“一视同仁”地对待所有Token排列,缺乏了人类语言那种自然的“从左到右”的因果关系,所以它的文本生成质量一直跟自回归模型不在一个量级上。
英伟达这套新方案的巧妙之处,就在于用同一个统一架构,搭起了这两种范式之间的桥梁,做到了“要精度有精度,要速度有速度”。

不需要外部援军:自己当自己的“打草稿人”
传统上,想要加速模型响应,业界常采用投机解码(Speculative Decoding)技术,比如引入额外的轻量级草稿模型(以Qwen-MTP或Eagle为代表)。但这带来了额外的维护和显存开销,调优起来也非常繁琐。
英伟达的创新在于,既然我们把扩散模式塞进了同一个模型里,为什么不直接用自身的扩散模式来起草多个Token,然后用相同的KV Cache在自回归模式下进行校验?
这套逻辑背后,完全依赖于其惊艳的“双管齐下”训练配方:在训练阶段,模型同时优化自回归损失(AR Loss)和扩散损失(Diffusion Loss)。为了让训练过程安定下来,团队设计了两阶段训练策略,并引入了全局损失平均(Global Loss Averaging)技术,解决了扩散大模型训练由于随机掩码引起的梯度暴增问题。
完成训练后,这个模型拥有了三个强大的分身,可在推理时任意切换:
- 自回归模式(AR Mode):完美保留经典的从左到右逐字跑完整因果注意力机制。最适合要求高精度且属于计算密集型的云端高并发场景。
- 扩散模式(Diffusion Mode):利用特制的双流注意力机制,在分块去噪过程中实现大规模的并行Token预测。英伟达甚至还搞了一个受训过的采样器替代常规的置信度阈值判定,进一步压榨出它的并行爆发力。
- 自猜测模式(Self-Speculation Mode):让模型左右互搏,免除第三方草稿模型负担。这种高接受率的投机,性能表现相当出彩。
实力掀翻旧格局:实测数据里的硬核表现
英伟达一口气拿出了3B、8B、14B三个规格的基座模型。在与各大开源自回归和扩散大语言模型的横向较量中,展现出了惊人的压制力。
在面对旧版扩散语言模型(如LLaDA、Dream和SDAR)时,新模型的准确率实现了9%到22.4%的巨大跨越,正式确立了新一代最先进(SOTA)扩散大模型的地位。而在保持自回归模式基线准确率能够与Qwen3-8B正面打平的前提下,它的前向传播每次平均能吐出5.9个Token。
在最为关键的部署落地测试中,基于8B尺寸的模型在单用户交互场景下的提速成绩单如下:
- 在DGX Spark平台上:FP8精度下提速3.14倍;在极速的INT4精度下,提速达到2.7倍(每秒输出112个Token,而纯AR模式仅为41.8个);
- 在RTX 6000 Pro显卡上:FP8精度加速3.4倍,INT精度加速也有2.3倍;
- 在GB200超级芯片上:直接带出3.3倍的硬件提速(高达850 Token/秒)。如果配合定制化的CUDA内核优化,理论极限值可达到夸张的4倍。

在聚焦于数学、代码及复杂推理的多任务跑分测试SPEED-Bench中,其独特的线性自推测机制斩获了8.7个Token的平均接受长度。作为对比,Qwen3.5-9B-MTP的数值为4.7,而Qwen3-8B-Eagle3也只有2.81。这一高难度数据充分证明了其实用投机机制的稳定性。
一种架构,全场景通吃
大模型怎么部署最让人省心?答案就是“不用换模型”。
在面对个人智能助理或交互体这种低并发场景时,自推测模式可以直接接管,提供超快的响应响应速度;而一旦遇到并发流量猛增的大型云部署、或者批处理规模突破64等计算受限的关卡,它只需要一行设置把掩码轻轻改回純AR形态。一套模型,便能兼顾全场景部署,运维成本和开发复杂度呈指数级下降。
英伟达这种将自回归和扩散模型融为一体的探索,为未来大模型的架构提供了一条更具启发性的路径:我们没有必要机械性地割裂两者的关系,让它们在一个共享参数、可自由变更注意力的Transformer架构里各司其职,可能是更优解。
论文中甚至为我们抛出了一个极富想象空间的暗示:如果未来能针对这套方案研发出真正完美的扩散采样算法,扩散模式甚至有空间比自推测模式再超越76.5%的性能上限。当限制速度的阀门彻底被拆下,不仅是极速交互,更长更复杂的文本“瞬时即得”的生活,真的不远了。




