狂甩第二名30分!深度机智夺下物理AI新王座,具身智能的数据闭环拼图拼完了?
导语:深度机智在WorldArena断崖夺冠,用极具说服力的成果,指明了物理AI数据引擎的下一代演进路径。
具身智能的竞争,正在走向一个让人兴奋也更具挑战的深水区。
一年前,当全球业界在为“怎么收集更多高质量真机数据”、“如何通过遥操作堆积轨迹”而焦虑时,一家刚刚在北京成立、由北京中关村学院与中关村人工智能研究院孵化的公司——深度机智(DeepCybo),却选择了一条有些另类的路线:拒绝本体数据堆叠,而是以“人类第一视角(Egocentric)数据”为原点,搭建一套涵盖空间智能、世界模型与策略学习的完整技术拼图。
当时,大部分人对这种“非主流”路线持否定或观望态度。毕竟在通往通用具身智能(E-AGI)的路上,大家都习惯了用已有的公式去解题。然而,在成立满一周年之际,深度机智交出了一份无可争辩的成绩单:在全球公认的具身智能权威榜单 WorldArena Track 2 (Data Engine) 赛道上,其世界模型 Z-WM 最终以 88.5 分的傲人成绩断崖式夺冠,将第二名甩开了整整 30.5 分。

分数不再由画质决定:世界模型评估范式的悄然更替
要看懂这 30.5 分的断崖式差距意味着什么,必须先理解 WorldArena Track 2 极为严苛的盲评机制。
在此之前,大家评估世界模型,往往看的是“看图说话”的像素质量——画面生不生成得像、动作反应对不对(这就是 Track 1 考察的内容)。但 Track 2 的数据引擎赛道,彻底摆脱了这种“外貌协会”的打分标准。它要求模型根据指令生成未来的合成视频观察流,并直接将这些数据注入到下游机器人的实际策略训练中,让机器人去进行物理仿真级别的闭环抓取。最后的打分,直接折算为机器人任务成功率的实际提升幅度。
换句话说,哪怕你生成的视频分辨率再高,如果在空间关系、重力、摩擦力等物理规则上存在一丝不自然,机器人在下游执行任务时就会立刻“穿帮”失败。Z-WM 跑出 88.5 分,这意味着它生成的合成数据具备极其高标准的真实物理一致性和实践有效性,能够真正当做“虚拟教练”来操练下游机器人。

在此之前,Z-WM 在评测生成数据感知质量与动作响应的 Track 1 中也以 64.96 分力压前榜首 WorldScape v0.2。而在本次竞技中,还有一个细节耐人寻味:仅凭语言指令驱动,在没有显式动作输入的前提下,Z-WM 就在 Track 1 总榜占到了第八的位置,直接超越了众多依赖“语言+动作”双重绑定的融合方案模型。这种表现,表明模型在庞大的训练管线浸润下,已经能够自主内化物理常识的核心脉络。
理顺具身智能的逻辑:先理解世界,再驱动行动
深度机智创始人陈凯曾提出过一个底层预判:具身智能通往通用化的最大绊脚石,根本不在于硬件的优劣或者算力的冗余,而在于机器人缺少对物理世界运行规律的底层理解。传统思路让机器人去死记硬背某一类物体抓取的轨迹,结果是只要环境微调、光影变幻,机器人就彻底抓瞎。深度机智主张的解法非常直给——“先理解,后行动”。
人类第一视角数据,正是这种物理直觉的最佳载体。当人去拿起一杯水时,第一视角的画面中不仅包含手的姿态,还天然融合了物品与周围环境的透视关系、时序惯性变化以及隐藏在操作背后的因果决策。这种高密度的数据资源,被深度机智充分挖掘,衍生出了涵盖五个层级的全栈技术闭环。
在底座,构建物理常识的源头活水
为了获取最为真实的情境数据,深度机智开创了 ICDC 情境数采体系。与纯粹的数据录入不同,它重点捕获的是人在真实空间中进行观察、决策并执行交互时的全流程语境。
通过这一套范式,他们沉淀出了庞大的第一视角多模态数据集DeepAct,时长已达数十万小时。再借助特有的 Egocentric2Embodiment 转换通道,视频中复杂的时间、空间与力学纠缠关系,被提炼为可以直接输入大模型进行学习的结构化经验。

在中枢,让具身通用基座大模型自我演进
在今年 3 月的中关村论坛上,深度机智对外展示了 PhysBrain 1.0,这也是国内首个实现零真机轨迹预训练的具身通用基座大模型。在该架构下,有三项创新技术形成了支柱作用:
- PhysBrain数据管线:从无序的视频中将物理先验规律结构化提炼;
- TwinBrainVLA双脑架构:将语义理解的“左脑”冻结,而将精细动作策略的“右脑”保持可训练状态,有效规避了灾难性遗忘;
- LangForce训练策略:利用贝叶斯分解强制模型在做动作前最大化意图与指令的关联。
得益于上述设计,在仅依赖 3000 小时第一视角数据训练的基础上,PhysBrain 1.0 在 SimplerEnv WidowX 和 Google Robot 上分别拿下了 80.2% 和 91.3% 的操作成功率,超越了 Pi0.5 等标杆模型,甚至在没有任何相关训练数据引导的情况下,展现出了惊人的自发纠错与策略变通能力。
在感知外延,以插拔模块强化空间多维智能
在此之上,深度机智还提供了灵活度极高的额外功能组:
- Euclid’s Gift:把复杂的欧几里得几何问题作为代理训练任务,成功在 VSI-Bench 与 MindCube 榜单登顶,不需要微调就能实现跨场景的零样本迁移。
- 3D-Mix:依靠轻量级语义自适应门控模块,为视觉语言动作模型(VLA)低成本注入三度空间知觉,将模型在未见环境(OOD)测试中的性能表现平均提升了 7%。
- IntentVLA:巧妙把历史视觉流序列压缩并映射为更短视野的意图信念,打消了部分可观测环境下的动作歧义。
在关键闭环,用世界模型实现合成数据闭环
这就是此次 Z-WM 在 WorldArena 大放异彩的秘密武器——EA-WM 世界模型与 STARRY 策略学习的深度咬合。
EA-WM 的核心目标是彻底解决低维动作控制信号与高维图像之间的“域错配”。通过 KVAF(结构化运动学到视觉动作场)技术,它直接将动作数据完美渲染为同步发生的视频视觉流。同时,配合 EDLS 事件感知机制,模型可以高度聚焦在夹爪与物体接触的细微物理节点,避免大量合成视频中常有的“穿模”或“违反重力”的荒谬像素抖动。
而 STARRY 则将这帧图像预测拉入扩散生成网络,通过 GASAM(几何感知选择性注意力调制)将机器人的动作关注区死死聚焦在关键受力面。两者相互辅佐,组成了自我供给的高质量物理合成跑道。
在终端,打造“Robot for AI”的同构硬件
最后,深度机智的硬件布局也并非单打独斗,而是高度服务于模型的实地部署。其全尺寸拟人体机器人“Prime”,具备 173cm 的身高与 72 自由度,且能在断电状态下自主保持平衡站立。Prime 的研发初衷就是将人类活动的第一视角同构映射为机器人拟人本体的物理运动,让大脑的决策意志以最平滑的折损过渡到四肢躯干。另外,用于商业场景落地的轮式版本 Prime U,以及专注科研教育的轻量硬件 Prime Lite 也组成了差异化梯队。
写在最后:具身智能下半场将拼什么?
深度机智这一整年的发展步调,极其紧凑也极有针对性。从 2025 年的底层数据平台搭建,到 2026 年初 PhysBrain 大模型的问世与数亿元的大手笔融资,再到如今在 WorldArena 上的惊艳登顶——这家“学院派+实战派”融合的团队,正用一套极其丝滑的技术演化路径,验证着其最初技术路线的远见。
当仿真数据能在极大限度上拟真现实世界时,真机硬件跑数据的时间和资金成本将会断崖式下降。目前,STARRY 已经先行在 ARX R5 真实双臂机器人生态上完成了实地验证,将其抓取平局成功率由 42.5% 一举拉升到了 70.8%。这一极具现实意义的增幅,让我们看到了世界模型在真实落地应用中的闪光前景。
具身智能的竞争风向已经起了显而易见的变化。从比拼买多少台硬件、测多少小时真机,过度到了比拼谁能构建一个让数据、世界模型和具身策略完美交融的自演进闭环。在这场长跑中,谁的闭环咬合得更紧密,谁就能在接下来的产业变局中抢得先机。

