RADAR:具身智能评测的“照妖镜”,揭露主流VLA模型真实鲁棒性不足74%

导语:RADAR基准测试如何揭示模型真实泛化能力的致命缺陷?

具身智能领域正面临一个尴尬的现实:许多模型在传统基准测试中表现优异,但一旦部署到真实物理环境,性能便急剧下滑。这种“现实鸿沟”严重阻碍了技术的实用化。为此,鹏城实验室与中山大学hcp实验室联合推出了RADAR(Real-world Autonomous Dynamics And Reasoning)——新一代具身智能评测基准,系统性地解决了现有评测体系的三大缺陷,为VLA(视觉-语言-动作)模型提供了真实可靠的泛化能力评估。

视觉-语言-动作模型架构示意图

为什么现有评测体系失灵?

当前具身智能评测面临严峻的“现实鸿沟”:模型在仿真环境中“封神”,却在真实世界中“翻车”。这主要源于三大系统性缺陷:

  • 忽视真实世界动态性:未考虑物体配置变化、机器人初始状态、光照变化、传感器噪声等关键因素。
  • 缺乏空间-物理智能测试:将任务简化为重复性操作,无法探测模型的几何推理能力。
  • 评估方法不可扩展:依赖简单的2D指标或人工监督,成本高昂且存在人为偏差。

RADAR的三大核心创新

1. 系统化的物理动态性建模

RADAR引入了“四维物理扰动轴”,全面模拟真实世界的复杂性:

  • 物体配置变化:随机位置、朝向、堆叠
  • 机器人初始状态:基座位置、臂的初始位姿
  • 环境光照变化:亮度、色温、阴影
  • 传感器噪声:RGBD相机的深度噪声、运动模糊

关键发现:在传感器噪声条件下,主流模型的3D IoU性能从0.261骤降至0.068,下降幅度高达74%,揭示了严重的鲁棒性不足。

2. 分级任务设计与空间理解测试

RADAR构建了四种场景复杂度递增的任务分组,并专门设计了测试空间理解能力的任务集,要求模型展现:

  • 基本的具身操作能力
  • 多目标长程任务能力
  • 复杂场景下的决策能力

这些任务揭示了当前VLA模型在空间智能方面的显著局限性,例如无法准确理解物体间的相对位置关系。

3. 全自动化评估流程(基于3D指标

RADAR的评估系统实现了完全自主化,具有以下优势:

  • 精确空间视觉:采用双视觉RGBD摄像头定位三维空间指标,捕捉真实的空间结构。
  • 零人工干预:全流程语义分割、3D重建自动化,消除人为偏差。
  • 可大规模扩展:轻量化的分割重建模型支持批量测试,成本低廉。
  • 结果可复现:多步骤可重试的标准化流程确保评测一致性。

快速上手指南

RADAR设计为“即插即用”,与主流VLA框架无缝对接。以下是简单的使用示例:

from src.client import RADARClient

session_id = client.get_worker()
client.begin_eval({"task_id": "single_red"}) #开始评测
status = client.get_status() #获取场景状态
action = model(status) #运行模型
client.send_action({"action_type": "test_action", "action_params": {}}) #执行动作
result = client.end_evaluation() #结束评测

RADAR评测流程

震撼发现:模型真实能力大揭秘

通过对多个主流VLA模型的系统性审计,RADAR发现了令人警醒的结果:

  • 脆弱性严重:在轻度物理扰动下,性能急剧下降。
  • 空间推理不足:模型缺乏真正的几何理解能力。
  • 泛化能力有限:仿真基准的高分数掩盖了在真实环境中的失效。
  • 关键数据:传感器噪声导致3D IoU从0.261降至0.068,下降幅度达74%[1]。

这些发现挑战了“传统基准高分=强具身智能”的假设,凸显了RADAR作为可靠评测标准的必要性。

RADAR的独特价值

  • 揭示模型在真实场景中的真实表现
  • 识别具体的弱点和改进方向
  • 公平比较不同方法的泛化能力
  • 推动研究从“刷榜”转向“真实鲁棒性”
  • 建立具身智能评测的新标准
  • 弥合仿真与真实世界的鸿沟
  • 促进可复现、可扩展的研究范式
  • 加速具身智能技术的实用化进程

RADAR不仅是一个评测工具,更是推动具身智能迈向真实世界可靠性的重要一步。通过系统化的动态性建模、专门的空间推理任务和全自动化评估流程,RADAR为领域提供了前所未有的洞察力。

参考文献
[1] Chen, Y., Zhan, Z., Lin, X., Song, Z., Liu, H., Lyu, Q., Zu, Y., Chen, X., Liu, Z., Pu, T., Chen, T., Wang, K., Lin, L., & Wang, G. (2026). RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation. arXiv preprint arXiv:2602.10980.

© 版权声明

相关文章