告别Token束缚!字节跳动携手何恺明新路径,开源Cola DLM打破自回归技术垄断
导语:字节跳动开源Cola DLM模型,颠覆Token传统,证明连续扩散在语言建模上的广阔前景。
大语言模型真的只剩下了“预测下一个Token”这一条路可以走吗?
继何恺明团队之后,字节跳动也用一份沉甸甸的开源成果给出了坚定的回答:不一定。双方在探索人工智能的漫长道路上,不约而同地将目光锁定了同一个被低估的蓝海——在连续语义空间中直接进行语言建模。
上周,何恺明团队推出的首个扩散语言模型ELF在学术界引发了震动,它绕过传统的Token编码器,证明了仅靠105M参数也能在连续的空间表达中跑赢主流的扩散语言模型。但这远远不是终点。字节跳动紧接着推出了全新的Cola DLM(Continuous Latent Diffusion Language Model),从理论探讨直接迈向了大规模工程实践。在参数量拉到2B、计算量达到约2000 EFLOPs的严苛对照实验中,Cola DLM不仅展现出了极其稳定的Scaling特性,更是用全套开源的论文、代码、模型权重与详尽的技术博客,将连续语言模型的潜力毫无保留地推到了聚光灯下。
表征才是主角:Token不过是语义在表层的权宜之计
要理解Cola DLM的颠覆性,必须先厘清一个经常被混淆的逻辑盲区。大多数人听到“扩散语言模型”时,脑海中浮现的可能又是将图像里的降噪扩散技术生搬硬套到文字领域的旧故事。但字节跳动对此非常清醒地指出:Cola DLM的核心出发点从来不是扩散(Diffusion),而是表征(Representation)。
Token并非语义本身,它仅仅是人类语言系统的一种历史演化载体,更像是一个被强加的表面外壳。举个生活中的直观例子,当不同的人用不同的句子表达同一种意图时:
- “我想喝水。”
- “帮我拿个水杯,有点渴了。”
- “整点水喝。”
在传统的自回归大模型(AR)世界里,这三句话由于Token序列的巨大差异,会被模型拆解为完全不同的单词序列分别予以记忆和存储。明明指向的是同一种内心需求,模型却必须在表层Token之间反复打转和拼死对齐。而在Cola DLM看来,如果能在模型内部构建一个抽象且稳定的“潜在语义状态”,这些看似迥异的表达其实可以自然地收敛到同一个相对集中的向量区域。
这种理念带来的最直接改变,是整个生成系统的深度分工。Cola DLM的内部运作流程被物理隔开为两个互不干扰的组件:一个专门负责在连续空间内生成抽象潜在语义的“Latent Prior”;另一个则担任翻译工作,将这些经过整理的信息统一还原成最终的自然语言文字。在这个路径结构中,模型不再做“在垃圾Token中去噪还原”的重复性工作,而是在内部把原本混乱的随机语义组织协调完毕,在吐出结果的最后一刻才生成具体的Token。这种将diffusion过程从“文字层”解耦并平移至“语义层”的手法,从根本上区分了它与市面上那些修修补补的传统扩散模型。
解密Cola DLM立足的四个工程硬核支撑
既然跳出了离散的Token地带,如何在没有实体词汇支撑的连续空间里站稳脚跟?字节跳动在这套架构的工程实现上,展现出了极其清晰且深思熟虑的方案选择。
一是通过Text VAE提炼“语义指纹”
很多开发者在初步涉猎连续扩散模型时,会本能地尝试直接在词向量(Word Embedding)上施加扩散操作。但那样做本质上仍然没有脱离Token序列的骨架限制。Cola DLM特意构建了一套高效的Text VAE架构:
- Encoder(编码器):负责将输入的离散文本进行强力压缩,剔除冗余,仅保留最核心的连续Latent变量,这相当于提取出了一段文本的“语义指纹”。
- Decoder(解码器):在最后阶段接棒,将这些随时间演变的语义指纹完美无损地映射回可读的词汇序列。
这让整个模型在处理数据时,面对的不再是冷冰冰的“下一个字”,而是整段文本背后流动的语义状态。

二是因果约束与流匹配的巧妙结合
为了保证信息沿着时序高效流动,Cola DLM舍弃了那种单纯加噪、去噪的常规生成体系,转而运用了在图像生成中表现优异的“流匹配”(Flow Matching)和“Block-causal DiT”组合。这种设计使得模型可以自一个平滑的高斯分布起步,直奔目标语义分布而去,在极短的路径中寻找到最佳的“运输轨迹”。同时,块内并行的局域语义组织和块间的严格因果逻辑,既保证了生成速度,又守住了长文脉落地时的前后一致性。

三是冻结Encoder与语义锚定机制
在连续模型的演进历史上,一个反复出现的顽疾就是语义空间的“悄然退化”。如果让负责编码的Encoder追随降噪模型的脚步一同训练,它们会非常功利地为了降低短期计算损失,把精心构建的Latent空间逐渐还原成极易预测的离散Token形式。这就让连续空间的努力付诸东流。字节跳动的解决手段非常彻底:在第二阶段的扩散训练中,直接冻结Encoder,逼迫生成Prior去被动地适应这个神圣不可侵犯的语义空间,并辅以BERT风格的约束损失进行物理定锚,从源头上保障了语义的完整度。
四是解耦自诊断评估指标
大语言模型之所以极难调试,很大程度上是因为传统的自回归体系将所有的理解、逻辑、记忆和输出技能统一混杂在了那条单一的交叉熵损失曲线里。一旦生成质量发生滑坡,开发团队很难迅速锁定制约瓶颈的究竟是哪个环节。为此,Cola DLM将训练任务完全剥离拆分:
- 重建任务:用于精确监测Decoder能否在给定Latent的前提下完全复原语句。
- 压缩任务:量化评估模型对海量上下文信息的提取效率。
- 拟合任务:专职追踪Prior网络刻画真实语义分布的精确程度。
正是在这样边界清晰的“自诊断”机制配合下,开发人员可以有针对性地对每一个软肋单元施加特训,这也构筑了Cola DLM面对大规模计算时能跑出极漂亮scaling特性的底气所在。

风暴前夜:探索二十年未有之变局
回顾过去长达数十年的自然语言处理历史,基于离散Token构建的自回归大模型毫无疑问是当之无愧的霸主。但站在此刻的产业拐点,自回归所附带的局限也像巨石一样横在行业面前:算力消耗随着上下文的延展而呈指数级飙升、KV缓存的存储代价难以为继、以及训练任务和真实生成策略在结构层面的深层断裂。
从LLaDA到ELF,再到如今字节跳动重构的Cola DLM,前沿探索的道路已经越来越清晰地指向一个崭新的彼岸——语言模型或许真的能够以一种完全连续的形式而存在。这种打破常规思维的技术洗牌,不仅让我们看到了未来大规模AI应用推理成本显著降低的可能,更重新激起了所有人关于“如何让AI捕捉人类思维深层本质”的深刻追问。随着开源社区对这套底层代码与模型权重的消化,围绕连续空间语言智能的下一轮进军号角已经悄然吹响。

