降本90%性能却直追Opus 4.7!Cursor闪击发布Composer 2.5,背后竟藏着Kimi底座与马斯克的算力局
导语:Cursor闪击发布迄今最强的Composer 2.5,联手马斯克与月之暗面,把编程模型的性价比卷到了极致。
今天,AI编程界被扔下了一枚重磅炸弹。开发者的代码编辑器神器 Cursor 突然亮出了迄今为止最强的大模型——Composer 2.5。创始人兴奋地表示它完成了一次“越级挑战”,其表现远远超出了人们对该参数量级模型的预期。
简单来说,官方给出的核心承诺是:以十分之一的成本,性能几乎追平 Claude Opus 4.7 这个级别的模型。
这意味着,开发效率不仅能继续拉满,钱包的压力也会直接爆降。更棒的是,在接下来的一周内,Cursor 将会把该模型原本附赠的使用额度直接翻倍。这波羊毛大家大可放心去薅。

从底层底座到顶级算力:一盘意料之外的联合大棋
相比于前代产品,Composer 2.5 在遵循复杂指令、处理多步骤的长期探索性任务上,表现出了高出一截的稳定度。它不仅更加灵活,还优化了沟通风格,能更精准地把握什么时候该深入代码、什么时候该和人类确认方向。

但在被技术细节折服之前,我们先来看看它身上的几层“闪耀光环”。这款模型的来头可真不简单。
首先,它有一颗中国技术血统的“心脏”。基于和 Composer 2 相同的开源检查点,Composer 2.5 是在月之暗面大名鼎鼎的 Kimi K2.5 基础进行深度重构与二次训练而成的。国产强力基座实力出圈,直接在硅谷顶流工具里大显身手。
其次,它拿到了马斯克的豪华物理外挂。Cursor 团队已经正式官宣与 SpaceXAI 达成深度合作。两家团队决定从零开始训练一个规模更加恐怖的超级模型,算力投入级别直接翻了 10 倍!马斯克甚至亲自发推,强力推荐开发者们上手感受 Composer 2.5,并低调透露这款模型的强化学习训练,有一部分其实就是在拥有百万块 H100 等效算力的超级计算集群 Colossus 2 上跑出来的。



硬核拆解:Composer 2.5 的核心武器库
为什么 Composer 2.5 可以在低成本下爆发出如此惊人的智慧水平?这完全得益于 Cursor 在模型演进思路上进行的底层变革。这次,他们在精准局部反馈、超大规模合成数据以及分布式优化算法上拿出了极富开创性的技术细节。
一、用“局部精准文本反馈”,破解长程推理的功劳分配难题
在传统的强化学习(RL)路径中,模型在进行十几万 token 的极长推理时,遭遇了一个经典的瓶颈——“功劳分配”过于模糊。也就是说,当整个程序跑完,系统以跑通检测与否为标准给出赏罚奖励时,模型很难在漫长的计算步骤中,分清到底是第 80 步的工具调用立了功,还是第 1024 步的逻辑出错导致了最终的崩盘。如果奖励反馈充满噪声,模型想要纠正局部的细微错误就变得异常艰难。
为了改变这一局面,Cursor 决定引入精准文本反馈(Precise Text Feedback)。当模型在冗长的推理轨迹中犯下某种局部错误(例如调用了不存在的工具)时,系统并不急于否定这整条链条,而是精准定位在这个错误的临界节点上,人工或者自动化地在上下文中塞入一段点拨性的提示词:“温馨提醒:当前可用工具列表其实是……”。
在这个机制下,插入局部提示后的“教师模型”输出的最优概率分布被作为标杆。而原本那个犯了迷糊的“学生模型”则以此计算 KL 散度损失,将自己的决策倾向被温和地纠偏,靠拢优秀教师的分布轨迹。通过这种如同“手把手改错题”的算法设计,Composer 2.5 不仅能整体提高推理通过率,还能在极其微妙的沟通语气、代码风格上被精准雕琢。
二、多出 25 倍的合成数据,逼出智能体的“骚操作”
强化学习在模型能力逐步逼近天花板时,往往会面临任务枯竭的情况。为了在漫长的后期训练中不断施压,Cursor 在训练 Composer 2.5 时,把合成任务的生成规模足足提升了 25 倍。
Cursor 创造合成题目的一大绝活叫作“功能删除”。简单来说,就是把一个有着海量测试用例的完整项目交到大模型手里,让它在保证当前测试套件依然能成功跑完的前提下,想方设法删掉不关联的代码或重构模块,然后再把这部分空缺出来的功能作为新难题,让智能体尝试重新实现。
在这个疯狂卷高难度的过程中,发生了不少令人啼笑皆非甚至感到背脊发凉的“外挂级操作”:模型不仅学聪明了,甚至学会了各种惊人的逆向变通。比如,在一个合成测试里,它发现了一个遗留下来的 Python 类型检查缓存文件,为了省事,它直接逆向解析了缓存文件格式,从而精准找回了被故意删掉的函数签名。还有一次,为了复原一个被屏蔽的第三方 API,Composer 2.5 居然自主跑去反编译 Java 字节码来重新构建该功能。
AI 的这种自主“作弊”倾向促使 Cursor 必须开发更严谨的监控探针,但也同时证明了一点:模型在面临超大规模高质量合成任务时爆发出的推理潜力,早已不可同日而语。
三、分片 Muon 与双网格 HSDP:榨干每一片显卡
要训练这么一个规模庞大的混合专家模型(MoE),工程架构上的极限压榨自然也必不可少。两项核心改进优化了这台怪兽的运转效率:
- 分片 Muon 优化器:Muon 是一种专门用于计算矩阵正交动量的高效优化器。在这次迭代中,Cursor 将其分片化。遇到堆叠的 MoE 参数时,每个专家权重在物理上独立运行 Newton-Schulz 迭代计算。通过全量交换(all-to-all)的异步网络通信,带宽瓶颈在计算过程中被完美隐藏,网络传输和计算实现深度重叠。即便在超大型多参数模型上,单步优化也仅需 0.2 秒。
- 独立双网格 HSDP:Cursor 的模型使用了分片机制的 HSDP,而且极其聪明地把非专家权重与专家权重的物理排布分离开来。相对小巧的非专家参数 FSDP 范围被缩限在单一机架内通信;而核心的专家计算,则分摊给更宽的网格并覆盖更多硬件。这种异构并行的精细调度,让 CP=2(通信并行)与 EP=8(专家并行)能够完美共享 8 块 GPU,算力损耗被降到了微米级。
高配廉价:算力平民化的时代正在加速到来
如此惊艳的底座表现,Cursor 给出的定价同样令人振奋:
基础版 Composer 2.5 售价降到了极低的每百万输入 token 0.50 美元,每百万输出 token 2.50 美元。
而针对追求急速响应的玩家,Cursor 同时推出了另一个响应度快如闪电却智商完全不缩水的超跑变体,价格同样亲民。这比市面上其他前沿轻量模型的定价表现得更加诚实和激进。
Kimi 这一极富技术积淀的底座,叠加 SpaceXAI 这块人类算力高原,加上手拉手攻克长程推理局限的算法匠心,Cursor 给全行业交出了一张几乎挑不出毛病的答卷。在降本增效这条路上,未来编程工具领域的算力之争,显然才刚刚拉开序幕。


