AI智能体自学技能,到底行不行?CMU与亚马逊联合发布首个系统性评测基准,实验结果出人意料

导语:CMU与Amazon AGI发布SkillLearnBench,首个系统性评测AI智能体技能持续学习。实验显示,当前方法生成的Skill与人类编写有巨大鸿沟,更强模型不一定更好。

在AI Agent领域,技能(Skill)正成为扩展能力边界的关键。开发者们开始将自身经验蒸馏为各式各样的Skill,让Agent在执行任务时直接调用,就像配备了一本“技能手册”。然而,高质量Skill依赖人类专家手工编写,而真实世界的任务千变万化,任何预设技能库都难以覆盖所有情况。为此,研究者们开始探索Skill的持续学习(Skill Continual Learning):让Agent在执行任务过程中自动积累Skill,边干边学。但一个根本问题随之而来:如何衡量不同持续学习方法的好坏?生成的Skill到底好在哪里、差在哪里?现有方法各自为政,缺乏统一评测,评估也多停留在任务成功率,难以深入分析失败原因。现在,来自卡内基梅隆大学(CMU)和Amazon AGI的研究团队推出了SkillLearnBench——首个面向Agent Skill Continual Learning的系统性评测基准,在统一环境下从Skill质量、Agent执行轨迹、最终任务结果三个层面进行细粒度评估。本文带你深入解读这项研究的关键发现。

CMU联合亚马逊发布SkillLearnBench:首个Agent技能持续学习系统性基准 | AI技能评估新范

SkillLearnBench:首个系统化基准,不止看分数

SkillLearnBench的设计核心在于任务必须真正依赖Skill,即Agent在没有Skill的情况下难以稳定完成。为此,基准包含了20个技能依赖任务、100个任务实例,覆盖软件工程、信息检索、数据分析等6大类别、15个子领域。每个任务都配有人类编写的Skill(Human-authored)作为参照,且每个实例都通过改变输入数据、参数、约束条件或表述方式来检验生成的Skill是否学到可迁移的任务流程,而不仅是对单个样例过拟合。同时,每个实例都配有确定性verifier,确保任务完成的客观判断。

更重要的是,SkillLearnBench构建了一套多维度评估框架。研究者认为,Skill持续学习方法会先生成Skill文档,随后影响Agent执行轨迹,最终决定任务结果。如果只看最终准确率,很难定位问题所在。因此评估被拆分为三个层面:

  • Skill Quality:Skill本身写得怎么样。研究团队引入coverage(覆盖度)、executability(可执行性)、safety(安全性)三个指标,评估Skill是否覆盖了解题所需的关键知识,是否完整、逻辑一致且可复用,以及是否存在安全风险。
  • Trajectory Analysis:Agent使用Skill后的执行轨迹是否合理。不仅看是否调用了Skill,还分析是否按照正确顺序完成关键操作。
  • Task Outcome:最终任务是否成功,以及完成任务消耗了多少token。

CMU联合亚马逊发布SkillLearnBench:首个Agent技能持续学习系统性基准 | AI技能评估新范

四种Skill学习方法大对决:Self Feedback表现最佳,但与人类专家差距显著

论文在SkillLearnBench上评估了四种有代表性的Skill持续学习方法:

  • One-Shot:单轮生成Skill,无反馈修正。
  • Self Feedback:Agent生成Skill并尝试任务,再根据自己的执行过程反思和修改Skill。
  • Teacher Feedback:引入外部teacher,根据失败情况给出修改建议,引导Agent多轮改进。
  • Skill Creator:使用Anthropic官方的skill-creator引导Agent生成Skill。

实验结果显示,所有持续学习方法整体上都优于no-skill baseline(平均准确率约10.17%),说明即使不完美,自动生成的Skill也能提供帮助。但它们与人类专家编写的Skill(准确率74.50%)之间存在巨大鸿沟:当前方法生成的Skill准确率大多在27%–31%左右,仅填补了部分差距。其中,Self Feedback在平均准确率和token效率上相对最优;Skill Creator的Skill调用率最高,但准确率并不总是最高,这表明Skill被频繁调用并不意味着它捕获了核心逻辑。

反直觉发现:更大模型未必生成更好Skill

实验揭示了一个反直觉现象:更强的LLM并不稳定地产生更好的Skill。强模型有时会写出更精确但也更“死板”的Skill,在特定实例上看似合理,但训练与测试实例变化后反而更容易失效。相比之下,中等规模模型有时能在具体性和泛化性之间取得更好的平衡。这说明Skill生成并非单纯靠扩大模型规模就能解决的问题,好的Skill必须抓住跨实例稳定的核心任务逻辑,而非堆砌细节。

结构化任务受益明显,开放式任务仍是软肋

研究还发现,Skill持续学习方法的收益高度依赖于任务类型。在软件工程和生产力工具这类流程清晰、可复用的任务中,Skill可以编码稳定的操作步骤,提升效果明显。而在开放性更强、实例差异更大的任务中,Skill可能过度约束Agent,反而拖累表现。这提示未来Skill生成方法需要根据任务特点动态调整粒度、结构和调用方式。

外部反馈胜过自我反思:Teacher Feedback带来持续提升

在多轮Skill演化实验中,Teacher Feedback和Self Feedback表现出显著差异。Self Feedback在多轮反思后并不总能持续进步,甚至可能出现recursive drift:Agent反复修改Skill,但没有新信息注入,只是重组已有内容,逐渐偏离正确路径。而Teacher Feedback引入外部指导,能在多轮中持续补充缺失信息,使Skill的coverage指标和任务表现逐步提升。因此,有效的Skill Continual Learning需要可靠的外部信号,如verifier反馈或专家反馈,而非仅依赖模型自我反思。

CMU联合亚马逊发布SkillLearnBench:首个Agent技能持续学习系统性基准 | AI技能评估新范

结论与启示:从“会说”到“真会”的路还很长

SkillLearnBench不仅是一个新benchmark,更提供了一个从Skill生成到调用再到完成的逐层分析框架。研究系统性地证明:当前的持续学习方法能生成有效Skill,但离实用还有明显距离。失败往往不是因为Skill写得不够“丰富”,而是缺少关键计算步骤、参数选择逻辑、验证机制或工具调用细节,即没抓住核心逻辑。同时,Skill必须被Agent正确发现、调用并执行,才能改变实际决策轨迹。

随着Agent从一次性任务执行走向长期自主学习,如何让它们从经验中提炼、保存并复用高质量Skill,将成为构建下一代智能体系统的关键。SkillLearnBench为这一方向提供了首个系统化评测平台,也为后续研究指明了清晰的改进路径:未来研究需关注Skill是否真正捕捉任务核心逻辑,以及Skill能否融入Agent的实际执行流程。

© 版权声明

相关文章