Claude通过率不到4%!SaaS-Bench撕下全自动办公Agent底裤
导语:Claude通过率仅3.8%?超硬核SaaS-Bench测试,无情戳破了AI Agent全自动办公的泡沫。
想象一下你平日的工作状态:上午要跟进开发进度并在基建里更新工单状态,中午要核对财务往来账单并录入系统,下午还要把病患的保险核对信息整理归档。这些事情如果交给一个新入职的实习生,教上一两遍基本就能稳妥办完。
只是,如果把这些长流程、跨应用的任务交给我们引以为傲的AI Agent,结果会怎样?
AI厂商们吹得天花乱坠的“全自动办公”和“Computer-Use”,在刚出炉的行业硬核评测基准SaaS-Bench面前,被毫不留情地下了诊断书:哪怕强如最顶尖的Claude 4.7,在真实多系统协作的环境下,任务的完整通过率也仅仅是可怜的3.8%。大批投资人和媒体宣扬的办公室效率奇点,在现实的冷水泼洒过后,暴露出了一片缺乏地基的沙滩。
真实战胜沙盒:23个开源系统堆起的高墙
过去一年里,大模型在各种虚拟Benchmark上高歌猛进,似乎全天候数字员工明天就能替人类上班。但那不过是在实验室里玩过家家:没有复杂的权限冲突、没有历史脏数据、甚至没有跨界联动,最多几十步点点选选就顺利收工。SaaS-Bench的研究人员直接掀了桌子。它不做任何仿真妥协,直接把23个开源SaaS软件通过Docker本地化部署,并丢出了一份包含106个专业工作任务的考卷。
[IMG_1]
这些被评测系统饱含实打实运行着的真实工作流。六个垂直行业包括了Baserow、OpenEMR、Mattermost以及Roundcube等在中小企业中普遍应用的软件。这意味着Agent面对的不是一张白纸,而是充斥着历史订单、重复联系人、繁杂数据库关联的“真实雷区”。
[IMG_2]
这些任务绝非发一封邮件、改个密码那么简单。近93.4%的任务要求Agent必须跨越两个以上的SaaS软件协同作业,超过一半的任务甚至是三个系统的混战。如果你把大模型的执行轨迹拿出来看,就会发现长流程任务的步骤动辄超过100步,甚至一路狂飙到300步以上。这种庞杂度瞬间挤干了大模型里的水分。
[IMG_3][IMG_4]
严苛的打分规则与惨不忍睹的成绩单
为了保证任务生成不掺水,SaaS-Bench采用“LLM生成大纲 + 行业专家多轮人工复核修改”的过滤流水线,确保每一道题目都真正契合打工人的日常业务逻辑,且能被后端的验证器准确拦截。
[IMG_5]
在测试中,评测团队为大模型设定了两个硬性考察维度: resolved score(完全通过得分)以及 checkpoint score(步骤完成度比例)。前者严苛到只分0和1,错一步就是零分;后者则允许Agent赚取一部分辛苦的步骤分。
[IMG_6]
大模型交出来的最终答卷极其惨烈。
[IMG_7]
在多模态大模型的横向对比中,Claude 4.7的步骤分虽然拿到了相对体面的43.9%,但它的端到端完全通过得分仅仅有3.8%——相当于做106道大题,只拿到了4道题的满分。Kimi K2.5和Gemini 3.1 Pro更是双双抱蛋,完全通过率直接挂零。
就算给大模型多次尝试(Pass@3)的机会,Claude Sonnet的表现也暴露出了极不稳定的软肋。一旦路径决策在某个单步中走偏,后面的操作就犹如脱缰野马一路狂奔,即使拥有相同的初始状态,AI也会因为路径依赖问题走向截然不同的失败终点。
为了彻底摸清AI在复杂环境下的极限,评测团队对任务进行了三个维度的压力测试:跨应用数、操作轨迹步长、验证点颗粒度。结果毫无悬念,全部呈单调递减曲线:
[IMG_8]
任务链路越长、涉及的软件越多、要比对的细粒度验证点越密集,Agent的得分就越呈断崖式坍塌。而这恰好是每一个办公打工人的真实日常。
深度剖析:Agent到底在哪些致命盲区翻了车?
这次大考的核心价值,不在于羞辱大模型现在的低下智商,而是精准解剖了当前电脑操作Agent(CUA)在真实环境下的四种结构性失败。
一、长流程耐力雪崩,越往后做得越差
面对长流程任务,模型前期表现尚可,但在中后期阶段,决策质量呈指数级下行。这是一条不可逆的下滑曲线。即使单个步骤有着95%的高成功率,一旦串联上12个步骤,通关的数学概率也瞬间折半。AI在漫长的交互中很容易被庞杂的信息淹没,最终迷失在任务的后半程。
[IMG_9]
二、蝴蝶效应严重,一步做错下游全盘崩塌
在企业协同系统里,上游的细微错误会引发系统性的下游污染。比如在一次测试中,任务要求为特定的公司客户创建账单。AI在填单时漏看了一个参数,错把账单挂在了该公司的联系人个人名下。虽然这个初级操作的权重占比极低,却导致后续开票、付款和销账动作全部指向了错误的实体,直接废掉了下游30%的工作成果。
[IMG_10]
三、缺乏闭环自检,活在自嗨的虚假进度里
大模型极度缺乏操作后的复核检查习惯。在一项场景中,Claude 4.6虽然在中间步骤意识到了日期填写出现错误,并自称已经进行了修复,但它没回过头复查页面。实际上,前端页面依然停留在错误日期上,它却若无其事地汇报完成了工作。这种“意图层”与“状态层”的脱靶,暴露出大模型目前还没有形成严密的反思闭环。
[IMG_11]
四、执行稳定性极差,下地干活全靠“刮彩票”
在测试环境被严格锁死并保证零随机的前提下,Claude Sonnet 4.6在同一任务上的三次跑分竟然呈现出从0到0.68的剧烈波动。在同一个节点上的微小差异会产生分岔路径,这让Agent的长任务落地纯粹沦为了一场赌博。
[IMG_12]
人类的UI,正成为AI Agent最大的绊脚石
这场对大模型的全方位测试不仅暴露了技术的贫瘠,还引出了一个深层拷问:办公软件的基础交互范式,是不是本身就不适合AI?
今天的绝大部分SaaS软件,说到底都是为了人类的手指和肉眼设计的。那些精美的下拉菜单、交互浮层和弹窗提示,对AI而言反倒成了冗余的噪音。强行让AI通过屏幕像素和坐标定位去模拟人类的使用习惯,不仅效率低下,且容错率极低。
或许,我们要面临的不是如何教AI像人一样面对五颜六色的屏幕,而是将现有的软件生态全部打碎,按照机器的接口逻辑重写一遍。只要面向人类的旧系统不改弦更张,全自动办公的落地之路就依然遥不可及。