百度DuMate双榜封神:AI智能体卷翻全球,靠的不是智商是执行力

导语:百度旗下AI智能体DuMate(搭子)今日在两大国际权威评测中双双夺冠,以碾压级优势刷新行业认知。它用实实在在的执行闭环证明:AI的下半场,拼的不是智商,而是把活干好、干稳、干得让人放心的能力。

今天,AI圈被百度一款名为DuMate(搭子)的产品刷屏了。在两大权威智能体评测榜单PinchBench(OpenClaw赛道)与DeepResearch Bench(深度研究赛道)中,DuMate同时登顶,以碾压级优势将Anthropic、OpenAI等明星团队甩在身后。

PinchBench上,DuMate以93.3%、93.2%的总分包揽前两名,前五名中独占三席,远超Anthropic的89.0%和OpenAI的91.6%;DeepResearch Bench则以58.03分拿下第一。如果说AI大模型过去比的是“脑力”,那这次DuMate证明,真正的生产力取决于“执行力”

不看智商,看交付

PinchBench不是一个考脑筋急转弯的榜单。它模拟了23个真实工作场景、147个具体任务,从多步推理、工具调用到任务闭环,全面考验AI能否把事情做完、做好、做稳。评测维度除了成功率,还包括速度和成本——就像老板看员工:不看你会不会说,只看你能不能交付。

很多模型在实验室里表现惊艳,但一遇到复杂的现实任务就频频“翻车”。DuMate之所以能霸榜,核心在于它让同一个底层模型跑出了远超原生的稳定性与效率,而这靠的不是堆参数,而是架构创新。

端云协同,把隐私和效率都留在手里

DuMate的杀手锏是端云协同框架Harness。简单说,就是把隐私敏感的计算留在本地设备上,而需要复杂推理的任务无缝上云,整个过程用户无需手动切换,系统会基于任务语义和历史行为自动判断、自动分配。

更关键的是,它还会按需组装上下文——只给模型注入当前任务需要的信息,减少无关干扰,从而大幅降低犯错概率。这相当于给AI配了一个“常务副手”,时刻帮它过滤噪声、排列优先级。结果就是:相同的模型,在DuMate的框架下执行力飙升,成本反而更低。

不是一次性产品,而是持续进化的伙伴

DuMate并非静态工具。它的Harness与Skills模块会根据历史执行轨迹不断迭代,让底层模型始终接近能力上限稳定发挥。从今年3月上线至今,已经做到一天一版的迭代速度,同时连续通过中国信通院两项最高等级安全测评,既强又稳,还安全。

当前的AI竞争,早已从“谁更聪明”转入“谁更会干活、更值得托付”的阶段。百度DuMate这次把执行闭环做到全球顶尖,也意味着中国AI正在从对话层真正迈向真实生产力层。下一次当人们讨论AI落地时,DuMate可能就是一个绕不开的标杆。

百度DuMate双榜第一:全球最能干活的AI智能体如何炼成?

百度DuMate双榜第一:全球最能干活的AI智能体如何炼成?

百度DuMate双榜第一:全球最能干活的AI智能体如何炼成?

© 版权声明

相关文章

暂无评论

none
暂无评论...