Dexbotic接入RLinf:具身智能研发迎来“SFT+RL”一体化新范式

导语:Dexbotic接入RLinf,打通具身模型SFT与RL后训练。

原力灵机开源的具身智能原生框架 Dexbotic 近日宣布,正式支持以 RLinf 作为分布式强化学习后端。这一更新并不是简单的工程适配,而是瞄准了具身智能模型研发中的关键痛点:长期以来,VLA(Vision-Language-Action,视觉-语言-动作)模型的监督微调与强化学习后训练往往被分割在不同工具链中,开发者需要在多个仓库、配置和数据接口之间反复切换。Dexbotic 与 RLinf 的打通,使模型开发、SFT Checkpoint 管理、RL 配置编写、任务启动与后训练能够进入同一条连续工作流。

Dexbotic接入RLinf:具身智能SFT与强化学习后训练一体化

从更大的行业背景看,大语言模型时代已经证明了“预训练 + SFT + RLHF”的有效性;而在具身智能领域,“VLA 预训练 / SFT + 大规模 RL 后训练”正在成为模型持续进化的重要路径。Dexbotic 接入 RLinf,正是这一范式从研究概念走向工程基础设施的关键一步。

Dexbotic接入RLinf:具身智能SFT与强化学习后训练一体化

不是“揉代码”,而是模块化拼装

此次整合最值得关注的地方,在于双方并没有选择粗暴 Fork 或深度耦合代码,而是采用了类似“乐高式协作”的模块化方式:Dexbotic 继续负责机器人策略定义、模型注册、Checkpoint 管理、数据变换和实验入口;RLinf 则专注于分布式 Rollout、优化、Worker 调度、日志记录与 Runner 编排。

这种边界清晰的合作方式,让两个框架各自保持原有优势。Dexbotic 不隐藏也不替代 RLinf,而是为 RLinf 的分布式强化学习能力提供自然入口;RLinf 也不侵入 Dexbotic 的策略生态,而是作为稳定可靠的后训练底座,为具身模型提供可扩展的强化学习能力。

通过后端适配器,Dexbotic 完整复用了 RLinf 原生的分布式能力,包括 Cluster、HybridComponentPlacement、Actor/Rollout/Env Worker 组以及 EmbodiedRunner。目前,该整合已经在 LIBERO 系列任务套件中完成端到端验证,可支持 PPO 等算法进行后训练。对开发者而言,这意味着从监督微调阶段得到的模型权重,可以更自然地进入强化学习优化流程,而不必重新搭建一套割裂的工程体系。

V-L-A 解耦:让机器人“大脑”不再是黑盒

具身智能系统需要同时处理三类能力:视觉感知、语言与逻辑认知,以及精细的动作控制。过去,这些能力常被封装在一个庞大且难以拆解的黑盒网络中。问题在于,一旦研究者想升级视觉模型、替换语言模型,或调整动作头以适配不同机械臂,往往都需要对整体系统进行大规模改造。

Dexbotic接入RLinf:具身智能SFT与强化学习后训练一体化

Dexbotic 2.0 针对这一问题,将 V(Vision Encoder,视觉编码器)、L(LLM,大语言模型)和 A(Action Expert,动作专家)进行模块化解耦。这样的架构使同一套系统能够在感知、认知和控制三个层面独立升级。例如,算法工程师可以接入新的视觉基座来测试空间理解能力,也可以更换不同 Action Head 以适配不同自由度、不同构型的机器人硬件。

这种设计符合软件工程中的“开闭原则”:系统对扩展开放,对核心结构修改保持克制。对于仍处于高速迭代阶段的具身智能来说,能否快速验证新模型、新数据和新硬件,直接决定了研发效率。

多源混训:同时学会“看懂”和“动手”

Dexbotic 2.0 的另一项核心能力,是多源数据混合训练(Co-training)。具身模型训练面临一个长期矛盾:互联网图文和视频数据规模巨大,但缺少真实物理操作语义;机器人轨迹数据包含宝贵的动作信息,却采集成本高、数量有限,也很难覆盖所有长尾场景。

Dexbotic 的思路是,让模型在同一套训练流程中同时吸收互联网多模态数据与机器人实操轨迹。视觉-语言模型可以从图像、视频和文本中学习通用世界知识,例如场景描述、任务拆解和对象定位;动作专家则在此基础上,将高维语义理解转化为连续物理控制序列,如抓取、移动、放置等动作。

多源训练带来的三类泛化能力

  • Caption:模型学习对场景进行准确描述,理解环境中物体、关系和状态。
  • Subtask:模型学习把宏观指令拆解为可执行的子步骤,从而支撑长程任务。
  • Grounding:模型学习将自然语言指令锚定到三维空间中的具体对象或位置。

在最新更新中,Dexbotic 进一步支持了 CogACT 与 Pi0.5 模型的 Co-training,即 Action Expert 与 LLM 的联合优化。互联网数据为模型提供通用语义理解,具身轨迹数据则提供可落地的操作技能。两类数据共同作用,使机器人不只会“说清楚”,还要能“看准确”并“做正确”。

SFT 与 RL 不再割裂:一条命令启动后训练

在大语言模型领域,SFT 让模型学会遵循指令,RLHF 则进一步让模型输出与人类偏好对齐。具身智能也在形成类似路径:先通过 VLA 预训练或监督微调获得基础能力,再通过大规模强化学习后训练提升动作质量、任务成功率和鲁棒性。

但在过去,具身 RL 的工程落地非常繁琐。研究者往往先在 Dexbotic 等框架中完成 SFT,得到模型 Checkpoint 后,再切换到独立的 RL 框架仓库,重新处理任务配置、路径适配、数据接口和环境启动。这种人为割裂不仅增加认知负担,也让实验复现和代码维护变得困难。

Dexbotic接入RLinf:具身智能SFT与强化学习后训练一体化

Dexbotic 与 RLinf 的整合改变了这一流程。开发者可以留在 Dexbotic 项目中,通过简洁命令启动完整的 RL 后训练流程;进阶用户仍可通过 Hydra 覆盖底层配置,以满足更复杂的实验需求。这相当于为具身智能策略提供了一套可调、可训、可持续增益的后训练闭环。

除了 RLinf 后端支持,Dexbotic 近期还支持基于 GRPO(群体相对策略优化)的模型后训练方案。该方案不依赖庞大的 Ray 框架,部署更轻量,同时支持环境多卡并行推理和点对点数据均匀分配,有助于提升 RL 训练吞吐量,让机器人从“能完成任务”进一步走向“更稳定地完成任务”。

从数据、仿真到真机:构建完整研发闭环

对于具身智能来说,模型架构只是研发体系的一部分。数据格式、仿真环境、评测基准和硬件适配同样决定了一个框架能否真正落地。Dexbotic 2.0 在“数据—训练—评测—硬件”四个环节上进行了系统性标准化。

统一数据格式 DexData

在数据层面,Dexbotic 提出了 DexData 统一数据格式,将 Prompt、子任务拆解、目标物体 3D 框选,以及机械臂 2D/3D 轨迹信息整合在一起。这样做的价值在于,减少不同数据源之间对齐和转换的工程开销,使互联网多模态数据、仿真数据和真实机器人轨迹能够更顺畅地进入训练流程。

适配主流仿真与真机评测

在仿真端,Dexbotic 通过封装 Docker 环境适配了 5 款主流物理仿真器,并将仿真训练数据转化为 DexData 格式,降低复现实验与横向比较的门槛。在真机端,Dexbotic 打通了大规模真机评测平台 RoboChallenge 的评测接口,使“开发—训练—推理—评测”的流程能够在真实物理世界中闭环验证。

此外,Dexbotic 新增对 UniNaVid 开源项目的支持,覆盖评测、SFT 训练和 DexDataset 数据格式适配,打通导航任务从数据接入、模型微调到 Benchmark 评测的链路。这对于视觉语言导航(VLN)和 Embodied Navigation 研究具有直接意义。

硬件生态持续扩展

在硬件支持方面,Dexbotic 已覆盖 ALOHA、UR5、Franka、ARX5 等机器人平台,并进一步加入星海图 Galaxea R1,接轨 NVIDIA GR00T N1,以加速人形机器人训练部署。原力灵机还推出了开源硬件 Dexbotic Open Source – W1(DOS-W1)与 SO-101,并适配 XLeRobot 生态。以 DOS-W1 为例,其设计图纸、BOM 表和组装代码均开放,快拆结构和抗疲劳设计有助于降低数据采集和设备维护成本。

DM0:从框架中孵化出的具身原生大模型

检验一个底层框架是否强大,最直接的方式是观察它能支撑怎样的模型。原文提到,基于 Dexbotic 框架研发的 DM0 大模型于 2026 年 2 月发布。DM0 被描述为全球首个从零开始训练的具身原生大模型,并在真机评测基准 RoboChallenge 上,以 2.4B 参数规模获得单任务与多任务双项第一。

Dexbotic接入RLinf:具身智能SFT与强化学习后训练一体化

DM0 的特点在于,其预训练阶段混合了操作、导航和全身控制三类核心任务,训练数据覆盖 UR、Franka 等 8 种不同构型的机器人硬件。这迫使模型学习更底层、更通用的物理操作逻辑,而不是记忆某一类机器人硬件的运动学参数,从而提升跨机型泛化能力。

依托 Dexbotic 的多模态数据处理能力,DM0 还构建了“空间推理思维链(Spatial Reasoning Chain-of-Thought)”。这使模型能够把环境感知、任务理解、运动规划和精细执行串联起来,完成更复杂的长程任务。例如,在“先寻找目标、移开遮挡物、再拍照发送”这类任务中,机器人需要连续完成目标定位、障碍处理、视角调整和动作执行,单纯的短程模仿学习很难覆盖完整逻辑。

快速迭代背后:具身智能基础设施正在成形

自 2025 年 10 月发布以来,Dexbotic 的迭代速度相当密集。原文列出的关键节点包括:

  • 2025-10-20:Dexbotic VLA 代码库开源,提出数据、模型、实验三大核心层级。
  • 2025-12-29:适配支持 Pi0.5 与 OFT 模型,打通相关开发链路。
  • 2026-01-08:发布适配 Blackwell GPU 架构的专用镜像。
  • 2026-01-15:NaVILA 导航算法、SimpleVLA-RL 合入主线,并推出 GRPO 轻量级后训练方案。
  • 2026-02-10:宣布与 RLinf 合作,发布 DM0 模型。
  • 2026-03-30:适配 XLeRobot、接入 NVIDIA GR00T N1,并为 Pi0.5 开启一键混训能力。
  • 2026-05-09:兼容 UniNaVid,将能力扩展至泛具身导航领域。

高频迭代也带来了生态反馈。Dexbotic 已服务包括清华大学、北京大学、普林斯顿大学、帝国理工学院在内的多所高校,以及腾讯、北京具身智能机器人创新中心等产业机构,累计触达研发者超过千人。

为什么这可能是具身智能的“PyTorch 时刻”

PyTorch 之所以能改变深度学习研发,不只是因为它提供了张量计算和自动求导,更因为它让研究者能够用统一、灵活、可扩展的方式表达模型、数据、训练和实验。具身智能目前也在经历类似阶段:模型越来越复杂,数据来源越来越多,硬件平台差异巨大,仿真与真机之间仍存在鸿沟。如果没有统一而开放的基础框架,研发效率将被大量工程细节消耗。

Dexbotic 的价值在于,它试图把具身智能研发中分散的环节纳入同一套工程语言:用模块化 V-L-A 架构承载模型创新,用 DexData 降低数据对齐成本,用仿真和真机评测闭环验证能力,用 RLinf 和 GRPO 打通后训练流程。对于开发者来说,这意味着可以更专注于算法和任务本身,而不是反复处理框架迁移、接口改写和实验流水线断裂。

当“大模型 + 机器人”逐渐从实验室概念走向真实应用,工程框架的协同能力将与模型规模、数据量和算力一样重要。Dexbotic × RLinf 的整合,标志着具身智能从“能训练一个模型”迈向“能持续迭代一个系统”。如果这一开放生态继续扩展,具身智能的基础设施层或许将迎来属于自己的 PyTorch 时刻。

© 版权声明

相关文章

暂无评论

none
暂无评论...