别再用视频生成忽悠人!港大小鹏端出新范式:给机器人的“大脑”直装物理直觉
导语:港大与小鹏机器人打造出DIAL新范式,摆脱繁重的像素级视频生成,以隐式世界模型让机器人萌生真实“物理直觉”。
目前阻碍具身智能大突破的,是两条割裂甚至互掐的路线。一条是专攻语义推理的视觉-语言模型(VLM)派,它头脑灵活、懂逻辑,却对现实世界的复杂物理规律缺乏直觉;另一条则是试图通过视频生成来预测未来画面的视觉-行动模型(VAM)派,它懂物理变化,但每一次运动都要伴随着沉重且昂贵的像素级视频生成计算。
为了给聪明的“脑”安上能预测未来的“物理手脚”,之前的折中方案是强行给VLM外挂一个体积庞大的视频生成器。但这种方案不仅系统极其臃肿,带来的高延迟更是将真机部署硬生生逼入绝境。机器人在真实环境里干活,哪怕延迟慢个半秒钟,都可能导致直接滑铲或者抓取砸烂现场。
能不能让大模型在自己原生的“脑海空间”里,跳过所有花哨的像素绘制,直接对现实世界进行物理因果预读?
香港大学、小鹏机器人以及北卡罗来纳大学教堂山分校的联合研究团队,给出了一个非常轻量且高维的解法。他们设计了一套名为 DIAL(Decoupling Intent and Action via Latent World Modeling)的全新端到端VLA框架。这套设计思路彻底放弃外挂独立模型或生成冗余像素,而是直接在VLM原生的特征网络深处进行隐式世界建模,在仿真测试和人形机器人实测中都取得了颠覆性的成绩。
传统VLA架构的硬伤:被当成“特征提取器”的尴尬
我们需要先剖析一下当前主流端到端VLA框架在落地时的痛点。在很多旧有模型中,极为昂贵且参数庞大的大模型只扮演了高级“特征提取器”的角色。算法直接把大模型生成的视觉-语言抽象特征提取出来,简单粗暴地映射到底层的物理连续动作输出上。
这种“小脑直接绑在大脑皮层”的做法带来的麻烦很顽固:一是白白流失了高阶大模型做长程逻辑规划的潜力,牛刀杀鸡;二是稳定性极差。直接用高频低级别的运动电流信号去端到端地反向调优大模型参数,极其容易破坏本已训练好的语义空间,导致表征遭遇意外崩溃。机器人在执行操作时,只学到了“画面变动与马达运动”之间肤浅的统计表象,并没有建立真正的物理因果回路。
DIAL架构对此做出了巧妙的“外科手术式”拆分。它借鉴了人类认知的双系统理论,不再要求大模型去直接纠结于每一个机械关节转动多少度,而是让它在自己原生的ViT(Vision Transformer)特征空间中进行极轻量化的“潜特征世界建模(Latent World Modeling)”。大模型预测出动作发生后的潜在视觉状态,以此构建出一个柔性可微的特征瓶颈,从而牢牢约束住底层控制器的行为。这种架构避免了粗暴反向对大模型带来的过度冲击,也为接下来融合跨设备数据扫清了障碍。
双系统协同运行,只算大局不磨蹭像素
在设计细节上,DIAL将具身智能的操作逻辑化整为零,交由两个并行的神经网络处理,并通过可微的特征空间将二者死死咬合在一起:

负责大局统筹的System-2(大模型大脑)不再去输出一连串零散生硬的具体步幅,而是结合当前拍摄画面和人类语言指令,在原生的ViT空间中模拟并预测“任务完成后未来的隐式视觉特征”。这个空间不需要渲染复杂的像素级画面,但其特征向量中自身就包含着极度丰富且紧凑的物理和语义地图。这个预描过程,即是机器人清晰的意图映射。
而负责微观落地的System-1则是一枚极轻的动作执行专家(隐式逆动力学模型)。它只做一道减法题:对比现实中当下的视觉特征,与System-2刚才大脑中设想出的“意图未来特征”,两者相减,算得特征差值,即可立刻推导出关节舵机想要抹平这个差距必须做出的动力响应。
告别梯度踩踏的两阶段独立调教
为了让这套协同机制不会因为训练梯度互相干扰而陷入死锁,团队引入了一套两阶段学习方案:
- 第一阶段:解耦独立预习。让大脑与小脑分开学习。大脑System-2仅用真实世界发生过的未来影像特征做标签,打磨预测现实物理演变的能力;小脑System-1则在已知真实未来特征的牵引下,全神贯注研学怎么把特征转变转化为精准的马达位移。
- 第二阶段:端到端全局合奏。打通两套系统的上下游管线,让小脑System-1正式使用大脑预测的“脑补特征”进行实操。此时,动作执行的反馈误差被允许化为连续梯度,稳定滑过阻隔离子,反哺并精雕细琢大模型的内部特征结构,直至促使其脑补结果演变成彻底契合真实操控的“动作感知意图(Action-aware Latent Intent)”。
真机硬核部署:顺畅攻克复杂长程任务
这套模型被直接接入了小鹏IRON-R01-1.11这一有着极多动作自由度的人形机器人上,专门经受了两个大类任务的无死角洗礼:

一类是涉及人类与机器人异体数据混合训练的“跨具身”基础操作(如平移抓放、液体倾倒);另一类则是完全没有人类数据垫背的,仅靠机器人本体运动轨迹淬炼的复杂“多阶段协同长程任务”(例如双手配合交接并放上货架、清扫垃圾至垃圾铲并成功倒入垃圾桶)。
在真机上手实操中,DIAL展现出极度强韧的表现。在多阶段交替的长线任务里,那份由大模型脑补出的隐式未来蓝图,像是一盏引路明灯。它保证了机器人在上一阶段(将垃圾扫入簸箕)干完的一刹那,能顺滑无缝地启动下一阶段(将垃圾倒入垃圾桶),完全斩断了以往VLA大模型极容易陷入的死循环动作(比如反复在空地上扫来扫去,却不知道该去端簸箕)。模型面对环境道具位置被意外踢偏、容器组合发生变动等棘手的域外分配(OOD)状况,基本都能从容调整姿态纠偏。
仿真与现实定量测试:10%的数据奇迹
单说真机表现还不够,团队在涵盖24种硬核日常任务的RoboCasa人形机器人仿真环境里进行了严格的定量评估。DIAL在GR1人形机器人桌面上跑出了 70.2% 的平均成功率,一举压制了原有的霸气基线算法。

尤为惊艳的是在极其严苛的少样本机制下,小脑与大脑的解耦设计爆发出强大的数据使用效率。DIAL仅使用了全部训练数据集的 10%,成功率便冲到了 58.3%。这一数据甚至挑落了使用 100% 满额数据集训练的此前最强基线模型,展现出隐式意图构筑的可微瓶颈所包裹的强归纳偏置。

打通人机壁垒:将人类视频化为底层营养
把丰富庞杂的人类动作录像转化成机器人的学习养分,是如今通往通用具身智能的公认捷径。由于强力松绑解耦的功能设计,DIAL可以无比自然地吞入异形数据。即便人类的手部动作与机械臂结构截然不同,该架构依然可以将人类骨骼姿势对齐并蒸馏提取。

System-2从人类操作第一人称或第三人称短片里提取大方向上通用的任务逻辑,System-1则基于人类动作库蒸馏泛化的运动力学常识。实验表明,当吸纳了多样化人类抓放案例资源后,DIAL对于未见过的陌生刚体物块抓取成功率由 34.8% 攀升至 41.1%,陌生未知容器的容纳适应力也从 53.0% 跳跃到了 58.7%。

在更微妙和高频扰乱的现实世界中,跨具身学习人类经验的优越性更为致命。烧脑的消融控制实验显示,一旦剥离掉从人类案例中吸收的知识,机器人的场景适应上限彻底崩塌。面对从未见过的异形塑料瓶抓取倒水操作,成功率从原先体面的 60% 直接高空滑坠,跌剩下可怜的 10%。这坐实了该机制确实帮助模型建立了难能可贵的泛化性物理直觉。
解密AI思维路径:大模型当真预判了未来?
为了扒开黑盒,洗清人们对“隐式特征是否只是一堆乱码”的拷问,团队利用PCA(主成分分析)方法将高维的特征通道降维处理,用经典的红绿蓝RGB数值染成可视化图像。
在将当前真实物理世界画面与脑部构想画面的降维色块进行直观比对时,惊喜出现了:System-2描摹出的隐式未来特征在与要抓取、倾倒等发生交互作用的目标物周围区域(如目标杯子、垃圾铲),和物理学意义上真实发生的最后结局表现出了惊人的结构相似度与空间对称性。通过追踪两者的动态差值图,人们发现变动剧烈的光标亮区,分毫不差地把未来的物理交互点圈画了出来。这论证了DIAL并不是蒙混过关,它是真的在用它原生的ViT语义空间编写一本物理运动路书。
走向下一个模块化进化时代
DIAL通过构建可微特征屏障,给整个大模型控制领域推开了一扇通往全新维度的门。从长线上看,它是通往通用机器人底座技术的一座关键路标。
如果我们能将这种隐式未来对齐的思想直接注入源头处大模型的原生多模态预训练任务中,利用互联网上如洪流般巨大的人类干活教学录屏,我们就极有可能锻造出天生即拥有深厚物理直觉的VLM模型。它的价值不单是消除了决策和动作的鸿沟,更在于它无可比拟的模块化进化优势。小脑控制器一旦训练成功后,可以保持稳定,而头顶上的感知神经网络大可跟随开源生态以日为单位狂飙迭代。这种即插即用的低配流转,必将加速具身智能新时代的到来。
感兴趣的开发者和行业人士可以通过以下资源深入了解该系统的开源设计:
- 项目主页:https://xpeng-robotics.github.io/dial/
- 开源代码:https://github.com/xpeng-robotics/DIAL