Claude通过率不到4%!SaaS-Bench撕下全自动办公Agent底裤 SaaS-Bench测试暴露出AI Agent在真实办公场景下的巨大缺陷。该评测采用本地部署的23个开源SaaS系统对模型发起长流程大考,结果显示最强模型Claude 4.7的端到端完全通过率仅有3... AI 前沿动态# AI agent# Claude# Computer-Use 2个月前280