开源即SOTA!Avenir-Web框架让网页智能体成功率飙升23.7%,三大模块破解长程任务难题
导语:Avenir-Web开源框架让网页智能体成功率飙升23.7%,三大模块破解长程任务难题,无需训练即可使用。
伦敦大学学院(UCL)、普林斯顿大学和爱丁堡大学的研究团队联合推出了 Avenir-Web,这是一套让多模态模型像人类一样使用网页的开源 Agent Harness 框架。在 ONLINE-MIND2WEB 基准上,它取得了 53.7% 的成功率,刷新了开源纪录,甚至超越了部分闭源商业方案。

Web Agent 的三大难题
研究团队指出,当前 Web Agent 在实际部署中面临三个核心瓶颈:
- 元素定位不准:过度依赖 DOM 树,在处理 Canvas、嵌套 iframe 等非标准结构时极易失效。
- 缺乏特定站点的流程知识:Agent 不懂得参考“用户手册”或“攻略”,只能盲目探索。
- 长程任务记忆不稳定:跨页面操作时容易产生“导航漂移”,陷入重复错误循环。
针对这些痛点,Avenir-Web 提出了一个模块化的 Agent Harness 框架,无需重新训练模型,即插即用。

Avenir-Web 核心模块设计
EIP 经验模仿模块:先读攻略再上手
人类操作复杂网站时往往会先搜索攻略。EIP 模块模仿了这一行为:在任务开始前,利用大模型的在线搜索能力检索目标网站的帮助中心、论坛或指南,将其转化为高层级的策略路线图。这大幅减少了盲目探索时间,规避了不可逆的导航错误。

MoGE 混合定位模块:视觉优先,兼容嵌套结构
MoGE 采用“视觉优先”原则,将整个网页视为统一视觉画布,直接基于坐标交互,天然解决了 iframe 嵌套问题。当视觉信息不足时,触发语义结构推理作为兜底方案,形成“视觉坐标+语义兜底”的混合策略,大幅提升了鲁棒性。

自适应记忆模块:结构化检查点与递归摘要
为防止 Agent “跑偏”,框架引入了任务清单,将复杂指令分解为 2-6 个可验证的原子里程碑,每一步操作后用轻量模型(如 Qwen-3-VL-8B)实时更新状态(Pending、In Progress、Completed、Failed)。针对长上下文引起的幻觉问题,采用分块递归摘要机制,维持滑动窗口将历史操作提炼为抽象记忆,并设置“失败反思缓冲区”确保从错误中学习。
性能实测:开源 SOTA,逼近顶尖商业方案
研究团队在 ONLINE-MIND2WEB(涵盖 136 个真实网站、300 个实时任务)上测试。以 Gemini 3 Pro 为内核的 Avenir-Web 取得了 53.7% 的成功率,相比开源标杆 SeeAct(30.0%)提升 23.7%,并且超越了闭源 Claude Computer Use 3.7(47.3%)和 ACT-1(52.7%),逼近 OpenAI Operator(58.3%)。
即使使用完全开源且轻量的 Qwen-3-VL-8B 作为内核,也取得了 25.7% 的成功率,接近早期基于 GPT-4o 的重型 Agent(如 Browser Use 26.0%、Agent-E 27.0%),证明了轻量模型同样具备实战价值。
消融实验揭示各模块贡献
- 去除 EIP 模块后,成功率从 48.0% 骤降至 36.0%,暴跌 12.0%,说明外部知识对 Web 任务至关重要。
- 去除 MoGE 后,成功率从 48.0% 降至 40.0%。
- 去除自适应记忆后,成功率进一步降至 42.0% 甚至 36.0%,定位与记忆模块均不可或缺。
尤其对于长程任务,递归摘要机制有效避免了上下文溢出带来的决策混乱。
开源与未来
研究团队表示,Avenir-Web 为具备人类级可靠性的通用数字助理迈出了坚实一步。该项目已开源(论文 | 代码),开发者无需训练新模型即可将其用于自动化、软件测试及智能助手等场景。