数据充足为何训练失败?中山大学团队提出MangoBench,揭示多智能体离线强化学习核心瓶颈 中山大学郭裕兰团队在CVPR 2026提出MangoBench基准,系统性分析多智能体离线强化学习在稀疏奖励与信用分配下的困境,揭示目标驱动与分层策略的有效性,为协作智能指明方向。 AI 前沿动态# CVPR 2026# MangoBench# 中山大学 2个月前390