一战封神!大晓机器人开源空间智能底座ACE-Brain-0,横扫19项SOTA,汽车、无人机、机器人通吃
导语:大晓机器人联合多所高校开源ACE-Brain-0,以空间智能为通用语言,横扫19项具身模型SOTA,实现汽车、无人机、机器人认知统一。
引言:跨本体智能的破局者
近日,大晓机器人联合上海交通大学、南洋理工大学、香港中文大学、香港大学等多家顶尖研究机构,正式开源了全球首创的跨具身本体通用基础模型——“ACE-Brain-0”。该模型以空间智能为底层框架,首次打破了汽车、机器人、无人机等不同物理本体的壁垒,重新定义了物理世界智能的技术底层逻辑。在涵盖空间认知、自动驾驶、低空感知、具身交互的24项核心评测中,ACE-Brain-0一举拿下19项SOTA(最优表现),全面大幅领先市场主流具身模型,性能提升幅度最高可达97.8%。
这一突破不仅刷新了具身智能的基线,更向行业展示了一种全新范式:先让AI学会“怎么看懂世界”,再教它“如何完成具体任务”。
空间智能:连接万物的“通用语言”
传统多任务模型通常将不同领域的数据混合训练,期望模型自行“悟出”规律,但往往导致能力稀释。ACE-Brain则另辟蹊径:它先让模型建立稳固的“空间感”——理解三维世界中的前后左右、远近高低、视角变换与几何关系,然后再逐步学习驾驶、飞行、操作等具体技能。这就像先教会AI一张通用的“空间地图”,再让它在不同身体上长出相应能力。
大晓机器人团队发现,无论是自动驾驶车辆、低空无人机,还是地面机器人,尽管形态差异巨大,却都依赖三大核心空间能力:三维空间结构建模、几何关系推理、场景演化预测。基于这一洞察,团队首次将空间智能定位为跨具身形态的“通用语言”,成为连接不同物理域的认知支架。
为实现这一目标,ACE-Brain-0采用以空间信息为核心的多模态自回归架构:输入层兼容单图、多图、视频,配合自然语言指令;表征层通过通用视觉编码器提取领域无关的空间特征,按“通用、空间、驾驶、航空、具身”分类组织;推理层由统一的LLM解码器完成跨模态融合推理,使不同场景的知识能基于空间逻辑自由流动。该设计无需为特定场景定制专用模块,仅凭统一的空间表征就实现了跨域知识的自然迁移,彻底改变了“一个场景一套模型”的传统研发模式。
SSR三阶段训练:巧妙化解跨域冲突
跨域训练一直以来都存在两大痛点:联合训练易引发梯度干扰,导致各域能力彼此消彼长;序贯训练则会造成灾难性遗忘,学会新技能便丢失旧能力。ACE-Brain首创的“Scaffold-Specialize-Reconcile(SSR)”三阶段范式,以“先建共识、再练专长、后融知识”的思路完美解决了这一矛盾。
- Scaffold(框架构建):利用大规模空间智能数据集训练空间专家模型,建立起域无关的三维认知先验,相当于为所有具身能力打造“通用地基”。
- Specialize(域专精学习):在空间框架之上,分别独立训练自动驾驶专家、机器人专家等领域模型,每个专家仅在自身专属数据上微调,避免梯度冲突,确保专业能力深度锤炼。
- Reconcile(跨域知识调和):通过任务向量空间对齐技术,在无需原始训练数据的条件下,将各领域专家的参数进行融合,同时缓解了联合训练的优化干扰和序贯训练的灾难性遗忘。
这种三阶段设计使得模型既能保有扎实的空间根基,又能发展出各自领域的卓越技能,最终融于一炉,成为跨本体的通用大脑。
四大能力统一:一个模型,多体共用
ACE-Brain-0首次在单一模型框架中实现了空间认知、自动驾驶、低空感知、机器人交互四大核心能力的深度融合。这并非简单的能力拼接,而是源于“共享认知结构”的构建。例如,自动驾驶中的“车距判断”与机器人抓取中的“距离估算”共享同一套空间距离推理机制;交通场景的“多视图融合”与机器人的“多视角物体识别”则依托相同的跨视角空间对齐技术。这种共享结构使模型能在不同观察视角、运动尺度和任务语义间自由切换,实现跨域理解与推理能力的自然迁移。
19项SOTA:横扫具身模型榜单
在严格的对标评测中,ACE-Brain-0与GPT-4o、Gemini 2.5-Pro、Qwen2.5-VL-7B-Inst、RoboBrain2.0-7B、MiMo-Embodied-7B等16个知名模型同台竞技,于19项benchmark上夺得SOTA,并将最强基线准确率相对提升5%至97.8%。以下为各领域的亮点表现:
空间认知:三维世界深度理解
- 视觉空间智能(VSI):综合评估空间布局、物体关系与尺度推理,ACE-Brain-0以63.3%领跑具身模型,验证了空间认知的通用性。
- 空间视角变换(SAT):考验不同视角下重构空间布局的能力,模型以92.0%的成绩大幅超越,较最好具身模型提升16.9%。
- 受限视角三维建模(MindCube):在有限视角下构建三维心理空间的能力,ACE-Brain-0以82.1%碾压对手,较闭源Gemini-2.5-Pro相对提升42.5%,较最佳开源模型InternVL3-8B提升97.8%。
自动驾驶:真实路况决策飞跃
- 真实驾驶场景理解(MME-RealWorld):模型以71.2%的准确率相对最强具身大脑提升18%。
- 规划与交通规则理解(NuPlanQA):决策正确率高达91.7%,较Pelican-VL-7B相对提升近10%。
- 在MAPLM、DriveAction、NuscenesQA等benchmark上也取得领先,多维动态场景理解能力突出。
低空感知:无人机视角全面称王
- 城市级无人机场景理解(UrbanVideo-Bench):以56.9%的成绩相对最强具身大脑提升51.7%。
- 空中交通关系推理(AirCopBench):多头无人机视角协同理解,成绩70.3%,相对提升35.4%。
- 空中几何推理(AVI-Math):无人机视角下几何计算能力,准确率35.0%,领先明显。
具身交互:操作与空间融合
- 机器人操作理解(RoboVQA):64.6%远超同类模型。
- 具身空间理解(EmbSpatial):77.3%,与人类认知更贴近。
- 长时任务规划(EgoPlan-Bench2):55.3%,具身导航(EB-Habitat)42.3%,均实现稳定提升。
这些成绩不仅彰显了单个模型跨多域的强大泛化能力,更验证了“空间优先”设计原则的正确性。
机器狗实战:复杂场景端到端自主
搭载ACE-Brain的大晓机器人具身超级大脑模组A1,已让机器狗展现出行业首创的端到端自主导航能力。在城市人行道等复杂场景中,机器狗能够精准量化行人与摩托车间距(约0.5米),解析自然语言指令,并自主判断“空间足够,谨慎前行”——集空间认知、视觉语言理解与安全决策于一体。面对车辆等障碍物时,它更能预判风险,主动停下并安全绕行。这种能力让机器狗在公共巡检、应急响应等任务中具备极高实用价值,无需定制化指令,即可通过自然语言交互安全高效地完成任务。
结语:空间优先,开启具身智能新范式
ACE-Brain-0的理论核心在于“可恢复的空间scaffold”——模型内部存在一个形态无关的共享几何变量,承载三维布局、相对位姿、深度等信息。后续不同本体只需学习各自身体特有的感知、动力学和控制,而无需从零理解几何世界。这从根本上回答了“为何是空间”这一深层次问题:空间是一切物理智能共有的坐标系。
ACE-Brain不仅以骄人分数碾压了现有具身模型,更重塑了“通用具身智能”的起点。真正的通用,或许并非任务列表的无尽扩充,而是先找到任务背后的共享结构。空间,就是它给出的答案。未来,不同形态的智能体可基于这一空间智能底座快速适配新的物理本体与应用场景,从自动驾驶到低空经济,从工业机器人到家庭服务设备,展现出面向真实世界的无限平台潜力。
项目链接:论文 | 项目主页 | 代码 | Hugging Face