仅占3.2GB显存跑出90%真机成功率,上海交大这套新方案扯下了3D具身智能的“落地遮羞布”
导语:仅需0.9B参数与3GB显存,上海交大Evo-Depth如何用轻量方案给具身智能补上关键的“空间感”?
要让机器人完成复杂的日常家务或者工业装配,精细的操作精度是绕不开的刚需。然而在具身智能的实际研发中,许多团队都会被同一个隐蔽的瓶颈折磨:哪怕给模型喂了海量的动作数据,当机器人真正面对细微摆放、避障或遮挡判断等任务时,依然会频频“手抖”甚至抓空。这背后的痛点,往往在于主流的VLA(视觉-语言-动作)模型太缺乏空间感知能力,本质上只是个依赖二维图像的“近视眼”。
为了给模型补上空间感,业界此前普遍在两条技术路线上做选择,但各自的限制都极为明显。第一条是显式3D路线,高度依赖深度传感器和实时的点云重建。这条路线硬件链路冗长、对多相机标定极其敏感,一旦机械臂微震造成位移偏离,标定就会失效。第二条是隐式3D路线,试图直接从RGB图像中强行学习几何信息。这虽然省去了硬件麻烦,但大多方案要扛起极重的通用基础大模型,训练与实时推理的开销让边缘微型电脑根本吃不消。
上海交通大学MINT团队最近开源的轻量化框架 Evo-Depth,给行业提供了一种极其务实的中间路线。它在不增加额外传感器负担的前提下,用约0.9B的紧凑体量,将隐式深度编码无缝写进了VLA策略里。它的亮眼之处在于,不仅在虚拟仿真端表现抢眼,在算力受限的真实物理机器人部署中,也展现出了极佳的落地性价比。
从整体的架构设计来看,Evo-Depth并没有走推倒重来的极端路线,而是以一种克制且高效的方式,将多视角RGB提取的深度特征巧妙编织入现有的视觉-语言通路中。整个解耦系统由三个核心模块协同工作:
1. IDEM:用隐式深度特征平替3D点云重建
以往为了获取空间感,我们不得不去生成高昂的3D显式点云,这在嵌入式端无异于灾难。Evo-Depth引入的隐式深度编码模块(Implicit Depth Encoding Module)仅包含约0.13B的参数量,其妙处在于不试图重建复杂的物理三维模型,而是通过多视角深度预训练进行初始化,直接从常规的多视角RGB图像中提取带深度偏置的几何表征。机器人不需要知道被抓物体完美的3D高精度模型,它只需要知道物体与周围环境的相对空间关系和布局就足够了。
2. SEM:不喧宾夺主的空间特征调制器
在融合语义与空间特征时,简单粗暴的拼接往往会带来计算延迟的大幅上升。空间增强模块(Spatial Enhancement Module)采用了更优雅的方式,将IDEM提纯出来的深度表征作为一种调制信号,隐式注入原有的视觉-语言通路中。这意味着原有VLM大模型可以继续专注于语义理解与逻辑交互,而SEM则像雷达HUD一样为视觉特征进行空间信息加持。这种松耦合的设计确保了系统不会因为加入空间维度而增加显存开销。
3. 渐进式对齐训练:解决多模态参数优化的不稳定
混合了语义、几何与动作空间的多模块联合训练极易引发梯度冲突与优化漂移。对此,研究团队设计了一套渐进式对齐训练法(Progressive Alignment Training),将学习过程拆分为三个平稳阶段:深度表征对齐、多模态融合、以及下游动作输出学习。负责终端动作输出的主体,则采用了当前在VLA领域颇具代表性的流匹配(Flow-Matching)动作头,以规避动作突变,输出平滑流畅的运行轨迹。
在性能、成本与实时性之间找到平衡点
衡量一个机器人策略的好坏,最终还要回归到真机部署的数据上。根据课题组公布的实测参数,这套约0.9B体量的小模型在实际运行中交出了一份惊艳的答卷:
- 仿真环境表现:在Meta-World仿真中达到84.4%的成功率,在VLA-Arena中为41.1%,而LIBERO与LIBERO-Plus测试中则分别斩获了95.4%和69.6%的优秀成绩。
- 物理真机考验:面对复杂的真实世界抓取和操纵任务,真机平均成功率稳定在约90%左右。
- 部署资源消耗:在边缘端部署仅占用约3.2 GB的显存,在保证轻量化的同时,能够提供约12.3 Hz的动作推理频率。
对于工业现场和动态交互环境中的实体机器人而言,高达12.3 Hz的实时运行频次以及仅需一张入门级显卡便能带动的超低开销,其商业说服力甚至超越了单纯的基准测试分数。毕竟,一个空有理论高精度却只能以1 Hz频率卡顿运行的“庞然大物”,在现实的物理控制回路中是难以发挥真正价值的。
这套模型不仅展示了如何在轻量化的限制下为VLA补齐致命的空间短板,更向产业界提供了一个面向落地的参考范式。当具身智能开始由“讲故事”逐步迈进“抠成本、要成效”的工业下半场,这种在性能、部署硬件要求以及动作实时性上取得极佳平衡的探索,或许才是推动具身智能真正走进各行各业的正确方式。