千小时数据击败万小时真机:具身智能的“物理常识”革命正在爆发
导语:深度机智发布PhysBrain模型,仅用千余小时人类第一视角数据,零动作轨迹预训练,便在多个具身智能基准上超越头部巨头,引发具身智能底层范式变革。
具身智能的泡沫与困境
2026年,具身智能赛道烈火烹油。Figure AI、Physical Intelligence等公司融资屡创新高,国内创业公司疯狂堆数据、抢场景、拼本体,十万小时真机数据成为军备竞赛新标的。然而喧嚣之下,一个根本性问题尚未解决:我们究竟在教机器人什么?是模仿动作,还是理解世界?
近期,微软亚洲研究院前首席研究员、深度机智创始人陈凯在中关村论坛上发布全球首个以人类学习范式构建的具身基座模型PhysBrain 1.0,仅使用千余小时人类第一视角数据、零动作轨迹数据预训练,便在多个国际权威榜单上超越使用数万小时真机数据的竞争对手,甚至比Physical Intelligence和英伟达等巨头表现更优。一场关于“物理常识”的革命悄然开启。
VLM与World Model的硬伤:缺乏物理常识
陈凯直指行业痛点:“目前不管是VLM还是世界模型,始终卡在一个点:它们缺乏物理常识。”现有视觉语言模型不理解空间与时序,视频生成模型视觉逼真但物理真实性堪忧。这导致机器人面对真实世界复杂任务时屡屡受挫。
问题的根源在于数据与学习的错位。主流方法——遥操作采集真机数据、仿真合成虚拟数据——本质上是在教机器人“模仿动作”,而非“理解世界”。陈凯比喻道:“现在很多做法是手把手教猴子干活,而我们尝试的是请菩提祖师把小猴子变成孙悟空,让它先理解世界,再学习技能。”这种“理解优先”的方法论,正是PhysBrain 1.0的核心理念。
人类第一视角数据:被重新发现的数据富矿
“人类第一视角数据,天然蕴含着各种物理常识。”陈凯解释为何押注这一路线。2025年以来,行业巨头纷纷跟进:特斯拉减少遥操作转向人类第一视角;Generalist AI发布“扔积木”拟人行为Demo;Physical Intelligence确认人类数据价值;英伟达发表论文交叉验证。行业共识迅速形成:人类第一视角数据是通往“物理常识”的关键路径。
但分歧依然存在。英伟达仍专注于手部轨迹预训练,而深度机智选择直接增强VLM本身——依据人看到的世界去理解世界。陈凯认为这种方式更具优势。更深层的差异在于数据的“多样性”:遥操作数据记录机器人视角,任务人工设计;UMI数据需人手持夹爪,难以想象工厂主会要求员工放弃双手。而人类第一视角捕捉的是真实生活细节——哪怕是安静发呆,光影流动也隐含空间关系与物理规律,这些数据都有价值。这种多样性不仅节省数据量,更带来学习质量的跃迁。
从“轨迹拟合”到“物理常识”:智能涌现的震撼
深度机智的实验观察到令人惊叹的“智能涌现”现象。训练数据全是成功的一次性抓拿放任务,但测试时机械臂在未夹住胡萝卜时竟“自发选择推”,推不进还会换角度加大力度,最后再切换策略夹起。另一个案例中,机械爪夹方块掉落,它主动回来捡,第一次失败后做了一个轻微旋转成功夹起。陈凯强调:“这种灵活性,甚至你都没有办法预编程把它搞出来。千小时人类数据增强物理常识,自发地把人类灵活变通的能力迁移到了机器人身上。”
这种涌现能力揭示了深层规律:当模型具备足够的物理常识,它就不依赖精确轨迹模仿,而是像人类一样“理解情境、灵活应对”。Generalist AI联合创始人将其称为“智能的暗物质”(The Dark Matter of Robotics: Physical Commonsense)。DeepMind的哈萨比斯也认为原生多模态模型能更好地理解物理世界,成为机器人大脑。陈凯总结:“所有点都归结为:先理解这个世界,再行动。”
跨本体能力:物理常识的迁移效应
“物理常识”革命的另一重要成果是“跨本体能力”的涌现。传统方法需对不同形态机器人数据做联合训练才能实现技能迁移,但深度机智发现:拥有理解物理常识的大脑,自然知道适配什么样的身体。用LoRA预训练action expert,再用Franka机械臂微调,数据需求大幅下降——“不同形态机器人背后的物理规律一模一样。”陈凯解释,跨本体是物理智能增强自然出现的结果,并非刻意混合多种机器人数据训练而成。这意味着物理常识具有跨平台的通用性,掌握“物体受力会移动”“抓取需要摩擦力”等基础规律后,就能迁移到新硬件平台,无需从头学习。这种通用性,正是通往“具身通用智能”的关键阶梯。
国内“人类学习路线”崛起与挑战
全球具身智能竞赛中,中美各有侧重:中国聚焦本体,美国聚焦大脑。但2025-2026年,国内开始涌现专注“大脑”的团队,深度机智等企业的崛起标志着重心转移。目前国内外在认知上与一流科学家差距不大,但需要更多投入。数据成本优势明显:美国标注第一视角27万小时耗费巨资,中国今年行业整体将达到千万小时人力历史数据。
2026年,“物理常识”革命仍处早期,尽管千小时数据涌现了纠错、变通、跨本体等能力,但陈凯承认这仍是“偶然的智能涌现”。年底是否会出现效果出人意料的大模型?两三年内能否重现ChatGPT时刻?更深层的挑战在于行业生态——物理常识的提取、标注、利用需要全新的模型架构与训练方法,与主流VLA架构不完全兼容,可能需要重构底层基础设施。但回报诱人:一旦机器人具备真正的物理常识,它将不再是“反复教什么,勉强会什么”的专用工具,而是“理解情境、灵活应对”的通用助手,彻底改变无数领域。陈凯认为这可能是人工智能的最后一个机会,也是最大的一次。