美团万亿大模型LongCat-2.0纯国产芯片全程训练!英伟达含量为零,国产算力迎来里程碑式突破

导语:美团LongCat-2.0-Preview以1.6万亿参数、100%国产芯片训练震惊业界,一举打破英伟达垄断,揭开国产大模型新篇章。

同一天双王炸:DeepSeek V4与美团LongCat-2.0正面碰撞

2026年4月24日,AI圈同时炸出两条重磅消息。一边是DeepSeek发布V4系列预览版,总参数突破万亿,支持百万上下文并宣布开源。另一边,美团悄无声息地亮出了自己的底牌——LongCat-2.0-Preview,一个同样万亿参数级的大模型,并且在训推全流程中实现了“英伟达含量为零”,完全基于国产芯片完成。业内首次,一石激起千层浪。

AI新纪元

当许多人还在争论国产芯片能否支撑大模型训练时,美团已经用事实给出了答案:万亿参数模型,不仅可以跑通,而且能稳定、高效地跑完全程。更关键的是,这并非依赖英伟达高端GPU,而是从训练到推理,全部由国产算力承担。即便是同日发布的DeepSeek V4,也仅将国产芯片用于首发推理,训练环节并未完全脱离英伟达。美团的这一步,无疑让整个国产AI生态吃下了一颗定心丸。

无声处听惊雷:从LongCat-Flash看国产训练的方法论

LongCat-2.0-Preview并非凭空冒出的奇迹。时间拨回到2024年9月,美团开源了5600亿参数的MoE模型LongCat-Flash。当时的技术报告里早已埋下伏笔。

美团LongCat技术报告

用词里的密码:加速器而非GPU

在LongCat-Flash的技术报告中,训练章节通篇使用“accelerator”而非“GPU”,而到了推理章节却明确标注了“H800”。这种刻意的区分暗示了一个事实:训练跑的那套硬件,不是英伟达。对于行内人来说,这几乎是一种明示。

显存的生死线:60GB这个数字反复出现

报告提到,经过V-ZB算法优化后,训练峰值显存被压缩到了60GB以下。如果是80GB显存的H800,这种优化意义不大;但若换成国产芯片单卡显存本就紧张,这60GB就是一道生死线。在后续开源的DORA异步训练框架论文中,团队再次点明:“our production cluster consists of midrange accelerators, especially with only around 60GB of available device memory”。一切豁然开朗。

算子自研攻坚战:确定性计算是排障的刚需

当训练平台从成熟的CUDA切换到较新的国产芯片生态时,基础算子要么缺失,要么性能不可接受。最典型的是FlashAttention反向梯度(FAG):国产芯片上原有的“确定性”实现为了计算顺序固定,退化为单核顺序执行,耗时比非确定性版本慢了20到70倍,根本无法用于生产。LongCat团队没有等待厂商更新,直接自研了高性能确定性FAG算子,性能损失控制在5%左右,既保住了确定性,又不牺牲效率,而且比官方版本更早、更优。

同样的自研重构也发生在Scatter类算子上。团队设计了一套确定性并行算法,将梯度聚合任务拆解到所有可用计算单元,性能提升数十倍。而对于GEMM这类高耗时模块,也采用了确定性Tiling策略加深度调优,实现了“高性能+确定性”的双重目标。

正是这些底层算子的深度自研,才让“整网确定性训练”成为可能。每一步的计算结果都能精确复现,任何异常都能快速定位。在国产芯片工具链尚不完善的阶段,这不是锦上添花,而是排查问题的刚需。

这也解释了为什么LongCat-Flash的技术报告花了大量篇幅讲述底层优化、确定性和稳定性套件——这些在当时看似“用力过猛”的举措,实则是用国产芯片训练超大模型必须跨过的门槛。

LongCat-2.0-Preview:万亿参数的新架构突破

在Flash验证了整套方法论之后,LongCat-2.0-Preview将其推向了万亿参数级。据接近项目的人士透露,该模型采用MoE架构,总参数约1.6T,平均激活参数约48B,同时支持1M超长上下文。在国产算力环境下同时支撑超大参数与百万级上下文,是对显存、通信与系统稳定性的综合考验。为此,团队在架构上做了几项关键创新:

N-gram Embedding:将参数前移,降低推理成本

传统MoE模型习惯通过扩展FFN专家数量来提升能力,但专家数增加会带来跨节点通信开销的快速上升。LongCat团队干脆将一部分原本在专家层的参数前移至embedding层,并引入N-gram(词组级)建模能力,使高频语言模式可以直接匹配命中,无需经过深层计算。这一设计让模型在保持1.6T参数容量的同时,在代码生成、指令理解和专业语义任务中表现更稳定,推理成本也明显下降。

轻量稀疏注意力 + 跨层流感知索引:稳定支持百万Token上下文

长上下文的主要瓶颈来自Transformer的O(n²)计算复杂度。LongCat-2.0-Preview引入了轻量稀疏注意力机制,并叠加“跨层流感知索引”设计,在不同层之间识别关键语义路径,减少了重复的全量attention计算。组合之下,模型能够稳定支持1M token上下文,推理延迟和计算成本仍保持在可控范围。

5万张国产加速卡托起万亿模型:软件工程弥补硬件欠缺

据可靠消息,LongCat-2.0-Preview的训练调用了5万至6万张国产加速卡,刷新了目前已知国产算力支撑超大模型训练的规模上限。在这样的大规模集群上,团队面对的挑战远超外界想象:

  • 显存与带宽约束:国产芯片单卡HBM容量和带宽较英伟达高端GPU仍有差距,必须在集群侧对1.6T量级的专家库进行极其精细的切分与调度,重新组合专家并行(EP)、张量并行(TP)与流水线并行(PP)。
  • 软件生态与算子效率:CUDA生态在算子库和调度效率上的优势短期难以复制,团队未依赖通用框架,而是对GEMM、注意力等核心算子进行了针对性重写与优化,并引入确定性计算机制,确保长周期训练的可复现与调试能力。
  • 系统稳定性:数万卡规模下,硬件掉线、通信抖动、任务中断成为常态。团队额外构建了容错与恢复体系,包括链路感知、自动重调度与多层异常检测,化解局部故障对全局的影响。

综合来看,在国产芯片上跑通1.6T模型,本质上是“用软件工程的勤奋,弥补硬件生态的欠缺”。尽管国产芯片在显存等硬指标上仍有差距,但在计算正确性、数值精度以及长周期训练稳定性这些核心指标上,已经能够追平国际水平,足以为万亿级MoE模型的全流程训推保驾护航。

国产算力:从“能用”迈向“好用”,开源生态可期

过去几年,行业始终萦绕着一个问题:国产芯片能不能支撑最前沿、最高强度、最长周期的顶级任务?LongCat-2.0-Preview给出了肯定回答。与DeepSeek V4相比,LongCat走得更远——从训练到推理,全流程完全国产化。这是一场产业级验证,证明国产算力正在跨过从“可替代”到“可承担顶级任务”的关键门槛。

当国产芯片开始承载前沿大模型并获得实际验证与背书,不仅为国产生态注入了信心,也为更深层的结构性变革打开了空间。如果说全流程国产化是“造出了车”,那么开源就是“修好了路”。LongCat的开放基因早已埋下:

LongCat开放生态

据悉,LongCat-2.0-Preview大概率将延续开源路线,具体方式和时间值得期待。目前,模型已开放内测,每天提供1000万免费Token额度,无论是技术发烧友想亲手跑一下这个全自研的万亿模型,还是企业开发者想评估国产算力API的可用性,都值得尝试。

内测申请:https://longcat.chat/platform/usage

© 版权声明

相关文章

暂无评论

none
暂无评论...