面壁智能发布MiniCPM-SALA:稀疏-线性混合架构,9B模型端侧跑通百万上下文,速度飙升3.5倍

导语:面壁智能正式发布SALA架构MiniCPM-SALA模型,首创稀疏-线性混合注意力,9B参数突破百万上下文处理,推理速度提升3.5倍,为端侧长文本应用打开新可能。

引言:长文本处理的算力困境

随着大模型能力跃迁,应用场景正从简单问答向复杂任务深度进化。模型需一次性处理整本技术手册、分析数万行代码依赖,或在多轮人机协作中维持连贯记忆。百万级词元处理能力成为前沿模型的关键能力。然而,主流Transformer架构的全注意力机制(Full Attention)面临着严重的计算瓶颈:计算复杂度随序列长度呈平方级增长,导致首字延迟(TTFT)急剧增加;生成过程中需存储所有历史词元的KV-Cache,长序列下显存占用可达上百GB。这成为实现超长上下文处理的“拦路虎”。

业界已涌现两大流派:稀疏注意力(Sparse Attention)与线性注意力(Linear Attention)。前者如DeepSeek的DSA,仅计算注意力矩阵中最显著的部分,试图打破计算墙,但仍然需要保留完整KV-Cache,存在“稀疏计算、稠密存储”的局限;后者如MiniMax、月之暗面等探索的线性注意力,将复杂度降为O(N),但极致效率不可避免地对上下文信息进行有损压缩,导致精度损失。面壁智能此次推出的SALA(Sparse Attention-Linear Attention)混合架构及其模型MiniCPM-SALA,则巧妙地融合两者优势,实现了性能与效率的双赢。

SALA混合架构:黄金配比破解瓶颈

MiniCPM-SALA首创稀疏-线性注意力混合架构,模型由75%的线性注意力层(采用Lightning Attention)和25%的稀疏注意力层(采用InfLLM-V2)交替堆叠而成。线性注意力负责全局信息的高效流转,以O(N)复杂度保证长序列处理速度;稀疏注意力则通过精细的块选择机制,让每个查询(Query)仅处理一小部分关键的键值对,精准捕捉局部细节,弥补线性结构的精度损失。这一黄金配比在计算资源与语义精度之间找到了最佳平衡点。

在位置编码上,MiniCPM-SALA采用HyPE(Hybrid Position Encoding)策略:线性注意力层保留RoPE,以最大程度与转换前的全注意力模型在参数分布上保持一致,减少转换性能损失;稀疏注意力层则采用NoPE(无位置编码),使历史KV-Cache不耦合任何位置信息,有效规避RoPE在超长序列下的长距离衰减问题,显著增强模型对极远距离信息的召回能力。下图展示了MiniCPM-SALA的模型架构。

MiniCPM-SALA模型架构图

Figure1:MiniCPM-SALA模型架构(图中展示了稀疏与线性层交替堆叠的混合设计)

高效训练范式:以25%的成本完成转换

MiniCPM-SALA并非从零开始训练,而是采用HALO算法将已有的预训练全注意力模型转换为混合架构,总训练量仅为从头开始训练同等水平模型的25%,极大地节省了算力。其训练流程分为五个阶段:

  • 架构转换(HALO):仅使用1.3B词元、序列长度512词元,快速识别并转换线性注意力层。此阶段仅转换后的线性层可训练,其余参数冻结,确保稳定过渡。
  • 持续Stable训练:在4K序列长度下训练314.6B词元,目标是将新引入的线性层与模型其他组件(全注意力层、FFN、嵌入层)充分对齐。此阶段关闭稀疏注意力以保持计算效率。
  • Short-Decay训练:以指数衰减的学习率训练1T词元,是训练量最大的阶段。数据上显著增加高质量筛选数据、PDF语料和合成推理数据,旨在通过高信息密度数据压缩知识,强化通用能力与逻辑推理。
  • Long-Decay训练:逐步将上下文窗口从4K扩展至32K、160K,最终达到520K词元,每个阶段分别使用102.2B、62.9B和50.6B词元。此阶段启用稀疏注意力机制并进行全参数训练,让模型学习两种注意力机制的协同作用。
  • SFT监督微调:使用高质量的推理密集型数据(代码、数学、知识、函数调用等)和专门合成的长上下文数据,在64K和140K上下文窗口下分别用204.5B和213.3B词元进行微调,激发复杂推理和信息检索能力。

性能全面评测:长文本优势显著,推理速度飙升

MiniCPM-SALA在多项长上下文基准测试中表现突出,同时在知识问答、数学推理、代码生成等通用能力上保持了与Qwen3-8B等现代全注意力模型相当的水平,真正实现了“长短兼备”。

推理效率:长度越长,优势越明显

在NVIDIA A6000D GPU(96GB显存)上的测试显示,非量化MiniCPM-SALA在所有序列长度下均保持更低延迟。在256K词元序列下,其首字延迟(TTFT)仅51.6秒,相比Qwen3-8B的180.8秒加速约3.5倍。当序列长度达到512K和1M时,Qwen3-8B因显存溢出(OOM)无法运行,而MiniCPM-SALA依然能稳定推理,彰显出卓越的显存利用效率。

端侧设备上的突破:消费级GPU处理百万上下文成为可能

在消费级RTX 5090(32GB显存)上,Qwen3-8B在非量化设置下仅128K词元即显存崩溃,量化后也只能支撑到256K。相反,MiniCPM-SALA成功扩展至1M词元上下文长度且未出现显存问题。这意味着在成本受限的端侧场景(如汽车、手机、具身机器人)中,本地运行百万级上下文模型已触手可及。此外,模型还展现出优异的长度泛化能力,在不使用外推技术(如YaRN)的情况下,可有效外推至2048K长度。

结语

MiniCPM-SALA的发布是大模型架构创新的一次重要实践。它证明了稀疏-线性混合架构能够以较小的训练代价,在保持通用性能的同时大幅提升长文本处理效率和推理速度,为极致推理性价比的实现提供了新范式。这一突破有望加速大模型在端侧设备的落地,推动更复杂、更长程的智能应用走向现实。

MiniCPM-SALA:稀疏-线性混合架构,9B模型在端侧跑通百万上下文

MiniCPM-SALA:稀疏-线性混合架构,9B模型在端侧跑通百万上下文

MiniCPM-SALA:稀疏-线性混合架构,9B模型在端侧跑通百万上下文

MiniCPM-SALA:稀疏-线性混合架构,9B模型在端侧跑通百万上下文

© 版权声明

相关文章