李飞飞团队再造“动作版”ImageNet!GPT-5与Gemini遭遇滑铁卢:具身智能迎来最强空间认知考核
导语:继ImageNet后,李飞飞最新发布ESI-Bench,通过“动作强制”让大模型体验了一把当人类的难度。
自计算机视觉奠基性工程 ImageNet 诞生以来,人工智能便在“看懂世界”这一方向上突飞猛进。然而,能够静态识图的 AI,是否意味着已经拥有了探索物理世界的基本常识?答案是否定的。近日,李飞飞教授团队再度出手,联合多所顶尖学术机构发布了全新的具身空间智能评测基准——ESI-Bench。这一重大突破旨在将研究视线从“被动视觉感知”彻底转向“主动感知-行动闭环”,测试当下的 AI 究竟能否像人类一样,在三维运动中获得真正的物理认知。
一、从“被动看图”到“主动探索”:ESI-Bench 重新定义空间能力
现有的主流空间智能评测基准(Benchmarks)大多建立在“被动感知”的模式之上。具体而言,就是直接抛给模型一张或几张特定视角的图片,然后提出各种问题,诸如“红色的杯子是否在柜子后面”、“抽屉里是否存在钥匙”。李飞飞团队尖锐地指出,这种评估方式测出的仅仅是模型的“视力”(静态视觉问答能力),而非真正的“空间智能”。
与此相比,人类探知物理世界的方式要主动得多。如果视线被遮挡,人类会探身绕到物体背面;如果需要判断容器容量,人类会把抽屉拉开、将水倒出来量一量。这一“感知-行动回路”(Perception-Action Loop)正是智能体在物理世界中赖以生存的根基。
为了弥补这一学术空白,ESI-Bench 孕育而生。它具备以下革命性特征:
- 庞大且复杂的任务体系:基准包含 10 个核心任务类别、29 个细分子类别,共计 3081 个任务实例。整个系统完全基于 OmniGibson 仿真平台构建,场景素材由大型 BEHAVIOR-1K 场景库提供支持。
- 植根于婴儿认知直觉:所有评测任务均围绕发展心理学家 Elizabeth Spelke 提出的四大核心知识系统设计——即人类婴儿天生具备的物理直觉:物体表征、布局与几何、数量表征、目标导向行动。
- 革命性的“行动强制”设定:在这套体系下,AI 智能体无法坐在原地静等图片输入,正确答案绝对不会隐藏在模型初始的单一视角中。智能体必须化身为行动者,主动通过合理移动、俯身观察、翻转物品等一系列动作来还原真相。
例如,系统内置的“刚性容纳”测试中,智能体需要判定一组不规则几何体是否能被装进指定的容器内。由于容器开口可能较小、内部可能存在隔挡,或是盖子遮蔽了视线,模型必须走上前去,低头查看内部甚至拿起来底朝天研究,才可能找对答案;而在“液体体积”任务中,为了比较两个杯子的真实容水量,模型甚至需要将虚拟水源倒进去进行测试,或是将其拿起来感知轻重。
二、震撼业界的三个残酷发现:GPT-5 与 Gemini 暴露致命缺陷
李飞飞研究团队使用当前全球最顶尖的闭源多模态大模型(包括 GPT-5 以及 Gemini 系列)在 ESI-Bench 上进行了彻底测试。结果表明,当前的 AI 距离真正具备空间智能的具身智能体还相差甚远。具体实验得出了以下三个颠覆认知的结论:
结论一:感知不是瓶颈,行动才是致命伤(“动作盲视”现象)
测试结果中呈现出一个令人振奋但也令人担忧的现象:主动探索确实行之有效,但模型自己很难找到那个正确的动作路径。
在没有预设额外行动指令的前提下,智能体内部会自发涌现出包括“绕侧观察”(move-behind)、“俯视”(top-down)、“拿起”(pick-up)和“倾倒验证”(pour-out)在内的空间策略。例如,当 Gemini 3.1 面对“部分遮挡”任务时,如果我们人为给它调配到上帝式的最佳视角,其任务准确率会从可怜的 14.6% 瞬间暴涨至 95.1%。多模态底座的感知能力实际上是合格的,阻碍它拿高分的是“找不到对的观测角度”。
相较之下,直接让 AI 接受无序的被动多视角数据,结果反而起到了相反的作用。例如给 GPT-5 输入数张随机视角的物体图片后,它在空间距离判断任务上的准确率反而从 53.9% 下滑到了 49.1%。研究团队将这一特征定义为“动作盲视”(Action Blindness):即一次糟糕的探索动作导致一个低质视角,低质视角又误导下一步决策,最终形成了不可逆的高级联失败。在高度依赖几何环境解析的遮挡任务中,主动探索策略的准确度与上帝视角之间的分值差异高达 49.7%。
结论二:不完美的 3D 重建并不是救命稻草
针对 2D 图像输入无法应对三维空间的局限,业界的主流策略一般是通过 3D 高斯泼溅(3D GS)或场景图重建三维世界,再在 3D ground 状态下做空间逻辑推理。
ESI-Bench 的测试表明,若是直接提供完美的 3D 真实真值(Oracle 状态),模型的推理表现的确有极大改善——如 Gemini 在解算“材质透明”任务时,其准确率从 2D 版本的 44.0% 直线上升至 3D 场景下的 60.4%。
然而当团队使用业界主流的高精 VGGT 模型为场景进行真实三维重建,再提交给推理模型评估时,悲剧发生了:在复杂的几何配置任务中,纯 2D 推理尚且能拿到 27.5% 的及格分,而经过 VGGT 场景重建喂入场景图后的得分却骤降至 9.9%。这意味着,不完美的 3D 重建不是中性的无功无过,而是负向失败。重建过程中不可避免产生的几何伪影、遮掩补全失真以及深度估值偏差,变相成为了毒害多模态推理模型的信息噪音,其效果甚至劣于单薄但至少不失真的 2D 信息。
结论三:模型缺乏元认知——它根本“不知道自己不知道”
研究深入对比了模型在探索时的轨迹与人类的差异,揭示出了二者之间最本质的“鸿沟”——元认知能力(Metacognitive Deficit)。
在静态被动观察实验中,大模型的判断力几乎足以比肩人类。Gemini 在部分遮挡任务下的得分能达到 88.4%(人类 benchmarks 为 87.4%),GPT-5 在光照透明度辨别中能拿到 96.3%(人类为 97.2%)。但一旦要求主动探索,差距便犹如天堑:
- 在物体物理接触测试中,人类准确率为 88.3%,而 GPT-5 仅为 64.2%。
- 在材质透明度推演中,人类准确度为 93.6%,而 Gemini 3.1 骤降至 52.3%。
人类的行为模式表现出了极高的“认知谨慎性”:如果观察存在一丝模糊,人类会刻意采取正交视角观察进行假设证伪,并随之降低对初步猜测的置信度。反观大模型,即便面前的线索模糊不清,它们也会在寥寥几步毫无建树的重复性移动后,过早终止探索,并以极其高昂的置信度给出完全错误、甚至违反客观物理规律的空间幻觉。模型缺乏内在的安全审核与自省机制,无法通过评估已有信息的充分程度来调整接下来的探索策略。
三、顶流华人学者天团与跨界艺术家的智慧结晶
这篇在学术界和机器人圈引发高度关注的力作,其背后的作者矩阵堪称惊艳。项目一作为斯坦福大学博士后 Yining Hong,她受教于 Yejin Choi、Leonidas Guibas、吴佳俊以及李飞飞等殿堂级学者,拥有 UCLA 计算机博士学位与上海交通大学电子工程本科背景。除科研之外,她还是一名出色的职业乐队音乐人,并担任了 CVPR 2026 社交主席,完成了科学与艺术的硬核跨界。
此外,本项研究的共同作者还包括加利福尼亚大学洛杉矶分校(UCLA)Mobility Lab 博士生刘家耕(Jiageng Liu,本科毕业于浙江大学图灵班)、以及在斯坦福参与科研实习的清华大学计算机系本科生尹晗(Han Yin)。在导师队伍中,亦汇聚了西北大学 Manling Li 助理教授、吴佳俊教授、Yejin Choi 教授、Leonidas Guibas 教授以及具身智能先驱李飞飞教授,为这一重磅项目的实研质量保驾护航。
ESI-Bench 的诞生标志着空间智能评测进入了一个全新的纪元。它揭示了现有多模态模型在“感知-动作链路”上的深重短板,并告诫所有从业者:具身智能的真正突破口并非单纯的眼力提升,如何打破“动作盲视”并在空间移动中形成求真探索的思维,才是实现通用人工智能(AGI)跨越物理边界的核心所在。