腾讯AI Lab终章:30B模型击穿万亿参数壁垒,“预习”式自进化如何降维打击?
导语:腾讯AI Lab诀别之作,凭借“预习”能力让30B模型打败万亿巨兽,为AI自进化指明新方向。
从被动响应的工具到自主进化的学徒,AI Agent 的每一次跃迁都在摆脱对人类的依赖。如今,随着“原生自演进”能力的出现,Agent 开始自己优化自己,不仅能降低高昂的Token消耗,还有望应对设计者都未曾预见的复杂场景。腾讯混元团队与香港科技大学(广州)联合发表的一篇论文,就为这种能力提供了全新的实现路径——而它,也是腾讯AI Lab在NLP方向的最后一篇论文。
轻量逆袭:14B击败Flash,30B碾压万亿旗舰
在最新的网页Agent任务评测中,仅14B参数的Qwen3-14B取得了33.1分,直接超越Gemini-2.5-Flash(28.5)和Kimi-K2-Turbo(28.6)。而当参数量来到30B,Qwen3-30B更是以42.5分掀翻了Gemini-2.5-Pro(36.1)和Kimi K2.5(36.2)两款万亿参数级旗舰模型。这种以小搏大的能力并非来自模型架构的魔法,而是源于一种被称为“原生自演进”的机制——让模型像人类一样提前“预习”环境,自行积累世界知识,从而在执行任务时大幅减少盲目的探索和反复的“沟通成本”。
何为真正的自进化?让Agent在没有任务时自主学习
以往的Agent自我进化大多依赖人类设计的奖励函数和流程规则,一旦外部监督撤去,成长便陷入停滞。论文通讯作者王琰曾打过一个比方:真正的自演进应该像让Agent拿到七本《哈利波特》后夜以继日地学习,等到用户提问时便能对答如流,而不是被问到才临时翻书。换句话说,Agent需要在不被告知具体任务的情况下,主动消化环境中的有效信息,沉淀为可复用的“世界知识”。
为此,团队提出了一种两阶段的原生自演进方案:
- 探索阶段:Agent获得环境的自由访问权限,并可以将提取出的重要信息写入一个
world_knowledge.md文件。这份文件就是该环境的压缩知识库。 - 执行阶段:当真正面对下游任务时,Agent直接加载预先生成的世界知识到提示中,无需从零开始摸索。整个过程不依赖任何人工奖励或任务提示。
核心难题在于:如何在没有客观标准的情况下判断生成的知识质量?团队的方法是用下游任务准确率反推:对同一环境生成多份世界知识,分别用于执行任务,哪个提升最大,哪个就是更优的知识。训练中使用的奖励信号仅用于这一筛选过程,而在实际部署阶段,Agent完全脱离奖励运行,真正做到了“无奖励”自我驱动。

训练两步走:从模仿教师到超越边界
为了让基座模型习得这种探索与压缩能力,训练被细化为两个步骤:
- Warm Up(热身):利用Gemini-2.5-Pro为每个环境生成8份不同的世界知识,选出质量最高的完整生成轨迹作为专家样例,对模型进行监督微调(SFT),让模型先“知道什么是好的世界知识”。
- On-Policy Training(在线策略训练):让微调后的模型自己去生成世界知识,并同样进行择优迭代。循环两次后,模型彻底内化了这种能力——提示词也从最初数万token的长模板缩短至不到一千token的简单指令,证明其自主性已不再依赖冗长的外部引导。
实验基于Qwen3-30B-A3B和Seed-OSS-36B两个中等尺寸基模,在WebWalker和WebVoyager任务上取得了令人瞩目的成果。
实验成绩单:跨模型迁移与效率革命
首先,世界知识的增益立竿见影:模型平均准确率从无知识时的30%跃升至49%,提升近20个百分点。这意味着智能体能够直接定位关键信息,避免了盲目跳转和遗漏。
其次,训练的效果不容置疑。仅经过SFT的模型已能与教师模型Gemini-2.5-Pro打平,而完成在线策略训练后准确率又反超5%。相反,让未经训练的基模直接生成世界知识,效果不升反降,说明这种“预习”能力必须通过专门训练才能获得,靠加长提示词无济于事。
最令人兴奋的是世界知识的跨模型迁移性。将训练好的模型生成的世界知识喂给四个从未参与训练的模型后,它们的成绩全部飙升:Qwen3-14B达到33.1,OpenAI-OSS-120B达38.7,Gemini-2.5-Flash达41.0,Kimi-K2-Turbo达47.3。就连训练基模本身也凭借这些知识超越了万亿旗舰。这表明,高质量的知识组织本身就是一种强大的资产,在某些场景下足以弥补数量级的参数差距。
效率方面同样喜人:世界知识带来的额外开销被压缩到很低(预探索成本可在海量任务中均摊至近乎为零,线上加载开销因缓存机制而低于5%),更重要的是,Agent执行任务所需的步数减少了17%,总Token消耗不升反降。智能体不仅更聪明,而且更快、更省。
告别与启示:AI Lab的最后一课
这篇论文是腾讯AI Lab在NLP领域的最终篇章。彼时,腾讯刚宣布撤销成立近十年的AI Lab,将其整体并入混元大模型体系。而这项指向“原生自演进”的工作,被普遍认为是为微信Agent等最高优先级项目铺路。虽然从论文到落地仍有距离,但它至少有力地证明:当AI学会了在没有任务指引时主动熟悉环境、沉淀知识,它就朝着像人类一样自主适应未知世界迈出了关键一步。腾讯AI Lab的九年历程,最终用一场惊艳的“预习”表演,为自身画上了句号。