AI Agent的“斯坦利时刻”:告别基准高分幻觉,直面职场执行鸿沟 Trainee-Bench通过模拟真实职场,从动态调度、主动探索、持续学习三维度评估AI Agent,结果显示顶尖模型成功率不足35%,并发任务下性能骤降,甚至出现“记吃不记打”的反常现象。 AI 前沿动态# AI agent# Trainee-Bench# 动态调度 2个月前460