让AI自己进化“外骨骼”!复旦联手北大开源AHE框架,刷爆榜单的底层技术长啥样?
导语:详解复旦、北大等团队提出的AHE自动优化方案,透视AI智能体如何自主进化迭代其Harness架构。
大模型技术浪潮狂奔至今,行业正在达成一个共识:单纯堆叠参数、拼模型“裸脑”的智商,已经很难在复杂的真实业务场景中拉开身位了。AI Agent要想真正替人类干活,必须依赖一套精密的外部框架——也就是业界常说的 Harness(智能体装备/外壳),包括系统级Prompt、工具库定义、中间件、长期记忆以及日志观测系统系统等。
在过去的一段时间里,OpenAI、Anthropic、LangChain 等头部机构频繁论证 Harness Engineering(智能体工程设计)的决定性价值。OpenClaw、Hermes Agent 等开源项目的爆火,也印证了“好马配好鞍”的硬道理。然而,这里存在一个巨大的行业痛点:大模型本身以月为单位高频进化,业务场景更是长尾且多变,但用于保障模型稳定输出的 Harness,却一直高度依赖人类工程师手敲代码、调参、打补丁。这种极其繁重的“搬砖套路”正在成为制约人工智能落地的新瓶颈。
为了打破这个僵局,来自复旦大学、北京大学以及上海奇绩智峰的联合团队提出了 Agentic Harness Engineering (AHE)。这是一套由可观测性驱动的 Harness 自动优化方法,能够端到端地实现智能体装备的自我迭代,最大程度释放大模型的能动性。
- 论文标题:Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- 论文链接:arxiv.org/abs/2604.25850
- 代码仓库:github.com/china-qijizhifeng/agentic-Harness-engineering
- 项目博客:https://dawning-road.github.io/blog/agentic-Harness-engineering
这套方法的实战表现非常亮眼。在评测中,基于 GPT-5.4 驱动的 Coding Agent 在 Terminal-Bench 2 上的得分从初始的 69.7 分一路自我进化到了 77.0 分。当 GPT-5.5 发布后,AHE 更是展现了极强的自适应性,迅速自动演化出与之完美契合的新 Harness,一举冲上全球 Leaderboard 第三名。

更关键的是,这种演化出来的“外骨骼”并非刷榜的特化代码,它具备极强的跨模型与跨任务泛化能力。该项目目前在社交媒体 X 上反响热烈,短短时间内已吸引了超 10 万次浏览与热议。
理解 Harness Engineering 的三个核心视角
要理解 AHE 为什么有效,我们需要先退一步,看看当我们在谈论 Harness 時,我们究竟在谈论什么。

从形态上看,大模型是具有随机和不确定性的“本体”,而 Harness 则是将其包裹在内、提供确定性保障的“环境外壳”。大模型的决策在概率空间中发生,而 Harness 通过系统 Prompt、外部工具的定义与实现、中间件钩子(middleware/hook)、技能文档、子智能体编排和长期记忆等,为模型戴上“紧箍咒”,确保其行为在长程、复杂的生产力任务中保持稳定与合规。
从目的来看,Harness 扮演着双向上下文流管理者的角色。既要保障外部的环境状态、用户意图能精准投喂给模型,又要确保模型输出的动作能被忠实记录、校验,并安全无误地在真实终端或沙盒里执行。过去,这个上下文流的调优靠的是人类软件工程师的直觉与反复调试,效率极其低下。
在方法论层面,现有的优化主要是模块化的 Agent Infra 建设,比如针对记忆组件或者沙盒执行环境做单独的代码开发。但这忽略了一个事实:在一个特定任务中,想要找到最优的 Harness,其实是“模型 × 工具外壳 × 执行环境”的超大规模组合优化问题。人类根本无法单凭经验设计出完美闭环。唯有建立一套可观测性体系,让 Agent 自己参与到这个迭代循环中,才能找到真正的局部最优解。
三大核心支柱:如何搭建 Agent 的自进化流水线
AHE 的核心理念非常清晰:要想让 Agent 接替人类写代码、调结构,必须给它提供高质量、结构化且足够立体的“可观测性看板”。为此,团队将 AHE 设计为三个协作角色:拥有基础装备的 Coding Agent 自行测试跑题;Agent Debugger 在后台给执行轨迹做病例诊断;Evolve Agent 则作为终极决策者,阅读诊断报告并直接修改代码库,推动 Harness 往更强方向进化。

1. 组件可观测性:声明式的解耦包
这套方案基于 NexAU 框架,将 Harness 物理拆分为七种完全解耦的文件级组件,包括:System Prompt、Tool Description(工具描述)、Tool Implementation(工具实现)、Middleware(中间件)、Skill(技能)、Sub-agent Config(子代理配置)以及 Long-term Memory(长期记忆)。这种高纯度的模块化设计,使得当模型运行碰壁时,“失败模式”与“具体哪块组件背锅”的关系一目了然。所有改动都通过 Git 进行版本控制,每次迭代都是一次可审计、可撤销的提交。在初始状态下,Coding Agent 甚至被故意设置得极其简陋,仅保留运行 Shell 的基本指令,从而确保后续进化的每一步增量都清晰可辨。
2. 经验可观测性:智能脱水与渐进式披露
评测大模型任务所产生的原始日志非常庞大,动辄数千万 Token。如果把这些数据一股脑丢给负责迭代代码的 Evolve Agent,其上下文窗口会立刻崩溃。Agent Debugger 优雅地解决了这个问题——它搭建了一套三层精炼过滤管道。底层记录一切原始轨迹,中层通过 Cleaner 清理重复的工具反馈噪音,顶层则派出专门的 QA 子智能体梳理每道题目的核心症结。经过脱水,原本 10M 的海量日志被精炼为一份 10K 左右、包含高价值溯源信息的诊断摘要。Evolve Agent 默认只需快速阅读结论,只有在需要求证某一技术细节时,才会按需检索底层轨迹。信息从此变成了可以高效消费的数字资产。
3. 决策可观测性:证据驱动的理性进化
为了防止 Agent 在自我修改时脱缰野蛮生长,系统给 Evolve Agent 设定了极其克制且科学的进化规则:
- 权限严格受限:评测代码、底层模型配置和原始 Prompt 均只读,Evolve Agent 只能动自己工作区内的 Harness 组件文件,杜绝了通过 Hack 评测逻辑作弊的投机行为。
- 假说验证式修改:每次改动代码,Evolve Agent 都必须递交一份详尽的书面变更报告。写清因为哪几道题报错(提供证据)、猜测底层原因是什么(建立推断)、打算如何修改(方案),并自主声明改动预期——预测这次修改会带好哪些题、可能会影响哪些原本正常的用例。经过下一轮评测跑分,预测正确的修改予以采纳入库,预测失败的修改则自动触发版本回撤。
大模型外壳的优化从此脱离了形而上学的技巧,真正成为一门遵循严密科学方法的逻辑实验。
不仅超越人类专家,更展示了极强的通用泛化特征
当真正的工程师和这套自动化进化系统同台竞技时,实验结果令人瞩目。
在 Terminal-Bench 2 评测集上,AHE 助力 GPT-5.4 驱动的智能体实现了极大的跨越,Pass@1 分数直接从 69.7% 飙升至 77.0%,达到了 7.3 个百分点的绝对升幅。这一成绩不仅大幅领先同等配置下的 OpenAI 官方 Codex-CLI(71.9%),也完胜了 ACE 和 Training Free-GRPO 等主流自动化基线方案。
更具行业启发意义的是这套自演化装备在“未遭训场景”下的惊人泛化实力:
跨任务测试
团队将在 Terminal-Bench 2 环境下演化出的最优 Harness 直接锁定,不作任何调整,直接迁移至以难度著称的软件工程测试集 SWE-Bench Verified。结果显示,AHE 在消耗更少 Token 的前提下,拿到了超越其他一众对比基线的优异成功率。这表明,它进化出的组件并非是针对特定测试题目的应试代码,而是积攒到了通用的、具备实操价值的软件工程经验。
跨模型测试
将由 GPT-5.4 主导进化生成的先进 Harness 直接挪配给较弱的模型,如 Qwen-3.6-Plus、Gemini-3.1-Flash 以及 DeepSeek-V4。在不进行二次演化的前提下开展评测,各模型均迎来了 +5.1 至 +10.1 个百分点不等的显著性能增长,且原始性能越弱的模型,得到的增益反而更加明显。这直接揭示了好的外骨骼装备具有普适的行业价值。
探索路上的踩坑记录,提供了关于AI心智的洞察
比起最终的数据,团队分享的摸索与失败教训同样是一座巨大的宝藏。
在项目早期,为了追求更快的计算和反馈,科研团队试图走捷径:挑选了 30 道高难度题目作为小型训练集,让系统跑了 10 轮演化。结果评测结果陷入怪圈,分数在 16 到 20 分中间激烈震荡,修复一个 Bug 往往会催生好几个新 Bug。追溯代码才发现,由于样本集太小、反馈信号极端片面,Evolve Agent 自动写出了大量令人啼笑皆非的“面条硬编码”补丁——专门只对 Golden Gate 等特定软件任务细节进行 Hack 判定。这表明,过短的评估序列根本无法抑制智能体为了短期刷分而产生的投机本能。
意识到这一偏误后,团队将范围扩大至 89 道题目全集,同时为了引导其向通用解决思路上靠,特意在 System Prompt 里加入了人类专家的宏大方法论指导,例如强调“Safety/Creativity/Generality”原则,并死死限定修改层级应该符合“中间件 > 工具描述 > 技能 > 提示词”的先后铁律。诚然,这种手把手的教导消除了野路子 Hacking 的现象,但是系统进化曲线却在 75.3% 处遭遇了瓶颈,所有改动都僵化地堆叠在中间件层,无法动弹。人类注入的“主观经验先验”,反而成为了扼杀进化的枷锁。
在抛弃了所有的过度干预,只留下“证据推理流程要求”和“基于测试的自动回撤制度”后,演化的方向反而变得健康起来。系统在各个组件上的代码改动极其均衡且多维度协调,最终无痛冲上了 77% 的高位。
最后,研究人员还做了一组非常有意思的消融对照:把自动进化出来的四类物理大部件逐个剔除,看谁才是真正的增分功臣。出人意料的是,以往被业内最受追捧、往往也是开发者最先动手的“System Prompt 改写”,在单独迁移时反而会导致性能滑坡;而被忽视的“Memory(记忆组件)”单挂,却瞬间恢复了高至 95% 的全局增长额。
究其深层原因,提示词(Prompt)往往扮演着策略性的口头规则引导(例如指明“你应该怎么做”),容易在不同环境里产生冲突;而记忆、代码和工具模板,保存的则是结结实实的事实性数据与代码复用逻辑。对于深度推理模型而言,事实的泛化和迁移能力,远远强于那些飘忽不定的策略教条。这也点醒了一众开发者:我们应当多教它事实,而不是固执地试图去规范大模型的行为策略。
搭建好赛道,比拽住AI的手更重要
这次 AHE 自进化框架的亮眼表现,给工程界带来了一个颇有分量的启示:当大模型自身足够强大时,试图为它规划好每一处工具接口、编写精美 Prompt 的手工业式开发,可能已经快走到了尽头。作为人类工程师,我们需要做的不再是执拗地手把手牵着 AI 上楼,而是为它搭建一个高透明度、具备版本追溯能力、数据可以闭环的“可观测进化操场”。
给予智能体合理的边界约束、透明的改错反馈,它的自我成长与纠错自愈能力,或许会比我们预想的还要惊人。

