国产GPU里程碑!摩尔线程MUSA原生入驻SGLang,DeepSeek V4已全面打通
导语:国产GPU首次以原生身份入驻SGLang主线,摩尔线程MUSA打通从DeepSeek V4到多模态模型的完整推理链路,开源社区共建者角色升级。

一场看似普通的Meetup,却几乎聚齐了SGLang、Triton、TileLang、Mooncake等大模型推理栈的核心维护者。主办方不是海外芯片巨头,而是摩尔线程。这背后释放的信号十分明确:国产GPU厂商正在从“追生态”转向“共建生态”,并首次在全球顶级推理框架中拿到了“原生门票”。

关键突破:MUSA后端正式合入SGLang主线
近日,摩尔线程宣布,其MUSA后端代码已成功合入SGLang官方仓库,成为该框架原生支持的后端之一。这意味着开发者使用SGLang运行大语言模型或多模态推理任务时,可以直接调用摩尔线程全功能GPU,无需任何第三方适配层。自上个月DeepSeek V4发布后,摩尔线程第一时间基于SGLang完成了V4的完整运行验证,打通了从核心计算引擎到端到端部署的全链路。

SGLang是当前最流行的开源LLM推理框架之一,DeepSeek V3的EP与PD分离方案便出自该社区。自2025年起,SGLang启动通用硬件适配,先后加入对AMD、英特尔芯片的支持。如今摩尔线程MUSA与这些国际主流芯片并列成为官方后端矩阵,标志着国产算力生态在AI基础软件栈中的地位发生了质变。
“零学习成本”背后的工程化实践
摩尔线程CTO张钰勃在技术分享中强调,公司坚持“通用计算”路线,通过MUSA开放架构拥抱开源生态。“我们不希望独立创造一套封闭的生态,而是以零学习成本,全面融入现有繁荣生态。”这种理念直接反映在SGLang的适配工程中。
自今年1月起,摩尔线程便向SGLang提交issue,提供了完整的MUSA支持路线图,涵盖Runtime支持、AOT Kernel、多模态生成、Docker/CI/Release等环节。开发者通过源码安装即可将SGLang部署在MTT S5000智算卡上,支持几乎所有基础模型,无需任何二次代码改造。针对迁移中大量torch.cuda原语的痛点,团队开发了torchada适配层,只需一行import即可自动将显存管理、流处理等CUDA接口桥接到MUSA平台。对于无法直接迁移或性能不佳的算子,则通过开源的MATE(MUSA AI Tensor Engine)高性能算子库进行替换与加速,其高阶Attention与GEMM算子已对接FlashAttention、FlashMLA、DeepGEMM等主流接口。

模型覆盖与能力矩阵
目前,摩尔线程已支持DeepSeek V4、Qwen3/3.5、Qwen VL视觉模型、MiniMax M2.5/2.7、智谱GLM 4/5系列等主流LLM。在扩散模型方面,完成了文生图、文生视频、图生图、图生视频的全覆盖,包括Qwen-Image、Wan等模型。量化方面,MTT S5000天然支持FP8,并已提供部分GGUF和INT4量化方案,让更多大模型能在国产GPU上高效运行。分布式上,基于MCCL通信库与自研Custom Allreduce,已支持TP/PP/DP/CP/EP等多种并行策略,并通过Mooncake实现PD分离。

截至5月12日,摩尔线程已向SGLang官方提交了47个PR(其中41个已合入主线),实现了从环境构建到分布式推理的全链路打通。MUSA正式成为SGLang官方原生支持的后端,并已列入2026 Q2的官方硬件矩阵。
技术沙龙上的开源大咖们
本次“SGLang × MUSA Meetup”上,多位开源项目核心维护者分享了与国产算力协同的最新进展:
- SGLang核心开发者BBuf介绍了框架基于TVM-FFI的Jit-kernel新体系,以及利用AI Agent自动完成超60项性能调优的Vibe Coding实践。未来将深化与MUSA的原生算子支持。
- 北京智源AI编译器研究员肖航展示了FlagOS生态:基于Triton的算子库FlagGems已涵盖497个算子,通过FusedMoE和FP8 GEMM等优化实现四倍加速。在MUSA平台上,利用张量加速引擎使DeepSeek-V4的TTFT时延降低56.7%,吞吐量提升65.7%。
- TileLang维护者唐正举阐述了该Tile级DSL用约50行代码即可实现媲美FlashAttention的性能,Attention-Sinks等算子加速比超20倍。与MUSA联调旨在构建全套高性能算子库,并继续推进分布式算子编程与自动调度。
- Mooncake贡献者马腾分享了推理解耦框架如何通过零拷贝RDMA传输、异构KV Cache池化及弹性EP架构,将RL权重同步时间从53秒压缩至7.2秒。摩尔线程已成为Mooncake项目的核心Maintainer之一。
从适配者到共建者
国产GPU的故事长期被简化为“对标英伟达”,但大模型进入生产部署阶段后,开源社区的深度参与才是生态硬实力的体现。摩尔线程不仅将代码合入SGLang主线,还在FlagOS、TileLang、Mooncake等项目的Roadmap和Maintainer名单中占据一席。正如沙龙所展现的,这些全球最活跃的开源推理项目,已开始将国产算力视作稳定的一极。单点硬件适配不是终点,建立获得社区持续认可的研发生态才是真正的破局之路。