深度机智获数亿元融资:用“人类第一视角”重构具身智能路线
导语:深度机智用人类第一视角数据重塑具身智能训练范式。
具身智能赛道正在出现一次重要的技术路线转向。过去两年,许多机器人团队的核心方法是让机器人通过大量真机或仿真演示反复模仿动作,再用规模化数据训练出可执行技能。但这种“轨迹拟合”式路线始终面临一个关键问题:机器人学会了“怎么做”,却并不真正理解“为什么要这样做”。
成立仅一年的深度机智选择了另一条路径:先让机器人像人一样观察世界、理解物理规律,再学习行动。该公司由北京中关村学院和中关村人工智能研究院联合孵化,是国内较早提出并系统化布局“人类学习”路线的具身大模型公司。围绕今年3月发布的PhysBrain 1.0具身通用智能基座模型体系,深度机智已经在多个国际权威评测中取得领先成绩,并首次披露累计完成数亿元融资。

从“模仿动作”到“理解世界”:具身智能路线正在变化
传统机器人学习方法更关注动作轨迹本身:给机器人大量示范,让模型预测下一步动作。然而在真实物理世界中,环境复杂多变,同一个任务往往会因为物体位置、材质、遮挡、受力状态的不同而产生变化。如果模型只是记住动作序列,就容易出现动作刻板、遇到变化无法纠错、与真实物理交互错位等问题。
深度机智的判断是,具身智能要走向通用化,机器人必须建立对物理世界的稳定理解能力。这也是其“人类学习”路线的核心:利用人类第一视角数据,让模型学习人类在真实世界中如何观察、判断、交互和完成任务。相比单纯的机械臂演示,人类第一视角数据记录了“人看到了什么、听到了什么、如何与世界互动”,能够为模型提供更接近真实生活的物理经验。
PhysBrain 1.0:围绕“数据—模型—算法—系统”构建闭环
与仅做单点模型或单一机器人本体的团队不同,深度机智从成立初期就围绕“数据—模型—算法—系统”打造完整闭环。其技术体系以PhysBrain 1.0为代表,目标是将人类经验转化为机器人大脑对物理世界的理解、预测和泛化能力,并进一步迁移到真实机器人身体上。
这一闭环可以拆解为三个层面:
- 数据侧:通过第一人类视角多模态数据,采集真实物理世界中的人类行为经验,覆盖多元交互场景。
- 模型侧:将这些经验转化为具身基座模型可学习的训练信号,让模型形成对空间、物理关系和任务目标的理解。
- 本体侧:通过拟人体机器人验证模型能力,推动从虚拟训练到真实执行的迁移。
据介绍,PhysBrain 1.0在学习效率上显示出优势:通过千小时级人类数据训练,取得了超过万小时级真机数据训练的性能表现。同时,模型还展现出一定的“灵活应变”能力,即在任务条件变化时仍能保持较高成功率。
五大国际榜单验证:多项指标达到或刷新SOTA
深度机智围绕“人类学习”路线形成了一组核心模型成果,并在WorldArena、SimplerEnv、RoboTwin 2.0、RoboCasa、LIBERO等五大国际公开评测中取得突出表现。这些榜单分别考察世界模型、泛化能力、双臂操作、家庭任务和多任务连续操作等能力,是具身智能模型性能的重要参考。
- WorldArena:深度机智的Z-WM_v1机器人世界模型获得64.96分,超过当时榜首的64.24分,并且在机器人落地核心维度上没有出现致命短板。
- SimplerEnv:在考验泛化能力的WidowX Robot测试中,PhysBrain 1.0取得80.2%的平均成功率,显著高于国际标杆π0.5的57.1%,达到行业SOTA水平。
- RoboTwin 2.0:在双臂操作泛化能力基准中,STARR动作生成增强框架在Clean和Random设置下分别取得93.82%和93.30%的平均成功率,刷新榜单性能上限。
- RoboCasa:在家庭日常任务泛化基准中,PhysBrain 1.0仅通过千小时人类数据进行VLM增强,即达到64.5%的平均成功率,达到行业领先水平。
- LIBERO:在多任务连续操作与领域适应基准中,TwinBrainVLA双脑架构取得97.6%的平均成功率;基于LangForce训练机制达到98.4%;融合数据、架构与训练方法后的PhysBrain 1.0基座模型体系达到98.8%,刷新行业最好成绩。
这些结果说明,深度机智并非只在某一个技术点上进行验证,而是在VLM、VLA、世界模型、空间智能等多个方向形成了可公开评测的模型能力。

DeepAct与Prime:补齐“数据+大脑+身体”三块拼图
去年12月,深度机智发布了首个基于人类第一视角的多模态数据集DeepAct。今年3月,在中关村论坛相关活动上,公司正式发布PhysBrain 1.0具身通用智能基座模型体系,并展示工业级全尺寸拟人体机器人Prime。
这意味着深度机智已经初步形成“数据+大脑+身体”的基础设施雏形:DeepAct提供高质量人类经验数据,PhysBrain 1.0承担具身智能基座模型角色,Prime则作为真实机器人本体,为模型落地与迁移提供验证载体。对于具身智能而言,这种系统化布局比单纯发布一个模型或一个机器人更具长期价值。
全球头部团队为何重新重视人类行为数据?
在具身智能领域,真实世界数据的获取一直是成本最高、难度最大的环节之一。英伟达创始人兼首席执行官黄仁勋曾指出,收集真实世界训练数据的过程缓慢且成本高昂,而且永远都不够充分。英伟达机器人方向负责人Jim Fan也提到,英伟达将押注第一视角人类视频。
从2025年下半年开始,全球具身智能领域的方向变化更加明显。Figure、Tesla等国际头部团队开始重新强调人类行为数据在物理常识学习、任务泛化和模型通用能力提升中的作用。背后的共同逻辑是:机器人如果想在真实世界中处理开放任务,不能只靠复现轨迹,而需要理解物体、空间、动作结果与物理约束之间的关系。
深度机智在成立之初就押注“人类学习”路线,彼时这一选择并不是行业共识。多数公司仍集中在真机演示数据和仿真数据上,希望通过更大规模的动作数据提升机器人表现。但深度机智认为,人类在真实环境中的行为本身就是高价值训练信号,尤其适合帮助机器人学习物理常识与通用判断能力。

规模化人类经验采集:突破数据瓶颈的关键
为了让“人类学习”路线真正可扩展,深度机智构建了规模化人类经验采集与转化体系,重点解决数据采集、清洗、标注和训练信号转化等难题。
- ICDC情景化数据采集方法论:公司研发了数十万小时级高质量人类第一视角多模态数据集,并完成四类数采设备研发,覆盖真实世界中的多样化物理交互场景。
- 自动化清洗与标注:团队研发大模型自动化数据清洗与标注技术,将真实世界中的人类经验转化为具身基座模型可学习的训练信号,从而降低数据处理成本,提高数据效率。
当数据采集和转化能力具备规模化基础后,人类第一视角数据的价值才有可能持续释放。对于具身模型而言,高质量、真实、覆盖面广的数据往往比单纯堆叠低质量演示更重要。

数亿元融资落地:国资、财务机构与产业资本共同入局
深度机智近期披露,公司成立一年已累计完成数亿元融资,其中新一轮融资额超过亿元。投资方包括中关村资本、诚通科创基金、北京熙诚致远等国资平台,普华资本、东方富海、蓝湖资本等财务机构,中科大校友基金、未来光锥前沿科技基金等专业投资力量,以及全球光伏龙头晶科能源控股旗下CVC基金,多家老股东也继续跟投。
据悉,本轮资金将主要用于数据基础设施建设、模型研发迭代和关键人才引进,进一步巩固公司在中国自主机器人大脑方向的早期优势。
这轮融资的意义不只在于金额本身,也体现出资本市场对具身智能底层能力的关注正在上升。国资平台更看重自主可控与国家战略方向,市场化机构关注技术深度与长期成长空间,产业资本则看重未来场景协同与应用落地。多类型资本同时下注,说明“人类学习”路线和具身基座模型基础设施正在获得更广泛认可。

复合型团队:AI、Physics与Robotics的交叉能力
具身智能不同于传统机器人,也不同于单纯大模型。它要求团队同时具备AI模型研发、物理世界理解、机器人系统工程和真实场景落地能力。深度机智的核心团队正体现出这种复合背景。
- 创始人陈凯:毕业于中科大少年班学院,在人工智能领域深耕15年,曾在国际上较早将人工智能模型分布式训练规模扩展至百卡以上,是深度机智“人类学习”路线的提出者,也是公司具身基座模型体系的核心牵引者。
- 联合创始人兼CEO张翼博:同样来自中科大少年班学院,拥有15年应用物理学背景,博士师从美国UCLA科学智能领域专家,以物理学训练和第一性原理思维支撑公司物理智能研发与战略路线构建。
- 联合创始人兼总设计师何旭国:深耕机器人领域十余年,曾担任机器人奥运会First Global Challenge青少年国家队总教练,负责拟人体本体设计、精细化操作系统,以及模型能力向真实机器人身体迁移的系统工程。
结语:通往具身AGI的长期路线
深度机智用一年时间完成了从数据集、基座模型到机器人本体的初步闭环,并在多个国际榜单上验证了“人类学习”路线的可行性。与依赖海量动作模仿的路线相比,它更强调让机器人先理解世界,再学习行动。这一思路正在与全球具身智能领域的趋势发生共振。
未来,具身智能竞争很可能不只是机器人硬件的竞争,也不只是单一模型参数规模的竞争,而是数据基础设施、物理世界理解、模型泛化能力和真实本体迁移能力的综合竞争。深度机智的下一步,将继续围绕“人类学习”路线加大投入,推动中国自主机器人大脑向更强通用性发展,并将最终目标指向具身AGI。