万帧级照片级仿真来了!GS-Playground如何重塑视觉机器人训练基础设施

导语:国产高保真机器人仿真器GS-Playground入选RSS 2026。

GS-Playground入选RSS 2026:万帧级3DGS视觉机器人仿真器解析

近日,清华大学智能产业研究院(AIR)DISCOVER Lab 联合谋先飞技术、原力灵机、求之科技和地瓜机器人,提出了新一代高通量视觉高保真仿真器 GS-Playground。该成果已被机器人领域国际顶级学术会议 RSS 2026(Robotics: Science and Systems)录用。

这项工作的核心意义在于:它试图同时解决视觉机器人学习中的两个长期难题——视觉足够真实训练足够高效。过去,研究者往往需要在照片级渲染质量和大规模强化学习吞吐量之间取舍,而 GS-Playground 的目标是把照片级视觉反馈的成本降到可规模化训练的水平。

GS-Playground入选RSS 2026:万帧级3DGS视觉机器人仿真器解析

  • 论文链接:http://arxiv.org/abs/2604.25459
  • 项目主页:https://gsplayground.github.io
  • 代码仓库:https://github.com/discoverse-dev/gs_playground

为什么视觉机器人学习需要新的仿真器?

具身智能研究正在从依赖关节角、速度、力等“本体感知”的路线,逐步走向更接近人类的“视觉感知”路线。换句话说,未来的机器人不仅要知道自己的身体状态,还要像人一样通过摄像头观察世界,再基于视觉信息做出决策。

但当机器人学习真正接入高保真视觉后,传统仿真系统的短板就会迅速暴露。GS-Playground 针对的正是视觉机器人学习中的三大核心痛点。

痛点一:高质量渲染会吞掉训练资源

目前主流的大规模并行仿真器,例如 Isaac Lab、ManiSkill、Genesis 等,在物理仿真吞吐量上已经有不错表现。但一旦叠加高分辨率、逼真的渲染管线,GPU 显存就会被物理计算与图像渲染同时占用,甚至频繁触发显存溢出(OOM)。

这意味着研究者常常被迫做选择:要么降低画面质量,让策略在“不太像真实世界”的环境中训练;要么保留真实渲染,但牺牲并行环境数量和训练速度。对于强化学习而言,样本规模直接影响训练效率和策略质量,这一矛盾非常关键。

痛点二:仿真资产制作依旧高度依赖人工

一个真正可用于机器人训练的数字孪生场景,不仅要“看起来像”,还要“物理上可交互”。这要求场景中物体具备视觉纹理、几何形状、碰撞结构、位姿、尺度等信息。虽然 3D 重建技术已经较成熟,但把重建结果整理成仿真可用资产,仍需要大量美术建模和工程调试。

痛点三:Sim2Real 迁移仍然困难

所谓 Sim2Real,是指在仿真环境中训练出的机器人策略能否直接迁移到真实机器人上。传统仿真中,画面与真实世界存在视觉差距,物理接触也可能不够准确,因此策略到了真实世界往往表现不稳定,需要额外的视觉随机化、参数调整和人工微调。

GS-Playground 的设计目标,就是从物理、渲染、资产生成三条线同时入手,缩小仿真与真实世界之间的感知和物理鸿沟。

全栈架构:从物理引擎到资产流水线的重新设计

GS-Playground入选RSS 2026:万帧级3DGS视觉机器人仿真器解析

GS-Playground 并不是在已有仿真器上简单叠加功能,而是围绕视觉机器人学习进行了全栈设计。它主要由三部分构成:高性能并行物理引擎、高效批量 3DGS 渲染引擎,以及自动化 Real2Sim 资产流水线。

1. 自研并行物理引擎:更强调接触精度与稳定性

GS-Playground 采用速度-冲量公式与严格互补约束的技术路线,基于国产自研跨平台并行物理引擎,可运行于 Windows、Linux 和 macOS,并支持 CPU 与 GPU 后端。

与 PhysX、MuJoCo、Taichi 等主流方案相比,该引擎选择以牺牲一部分梯度平滑性为代价,换取更高的几何精度。其优势体现在刚体接触、静态平衡和大时间步长仿真上:系统可在 dt=10ms 的大时间步长下保持稳定,不易发散,特别适合抓取、堆叠、碰撞等需要精确接触建模的机器人操作任务。

在工程优化上,团队实现了两项关键机制:

  • 约束岛并行化:将约束图动态分解为多个独立子问题,并分发到多核 CPU 上并行求解。
  • 时间相干热启动:跨帧复用上一时刻的冲量结果,将 PGS 迭代次数从 50 次以上降低到不足 10 次。

在高约束密度测试场景中,例如 50 个 27 自由度人形机器人并行运行,GS-Playground 达到 1,015 FPS 吞吐量,速度比 MuJoCo 快 32 倍,比 GPU 端 MjWarp 快约 600 倍

接触稳定性方面,团队通过牛顿摆、Boston Dynamics Spot 大步长稳定性测试、密集货架多体交互实验等方式验证引擎表现。在抓握鲁棒性的“摇晃测试”中,GS-Playground 的 CPU 后端在所有物体几何形状和时间步长配置下均实现 100% 成功率(90/90);相比之下,MuJoCo 多个变体的成功率几乎为零,Isaac Sim 与 Genesis 的成功率约为 67%。

2. 批量 3DGS 渲染:单卡实现 2048 环境万帧吞吐

GS-Playground 在视觉侧的关键创新,是选择 3D Gaussian Splatting(3DGS,三维高斯泼溅)作为渲染表示,而不是传统光线追踪或光栅化方案。3DGS 能够以较高效率表达照片级场景,同时更适合进行批量化渲染优化。

围绕 3DGS,GS-Playground 构建了面向吞吐量和显存效率的批量渲染后端,主要包括三项设计:

  • 高效点剪枝策略:仅保留约 30% 的高斯点,PSNR 损失不足 0.05dB,对视觉运动策略影响很小;对于动态物体和机器人本体,还可进一步压缩到仅保留 10%。
  • 刚体链高斯运动学(RLGK):将数百万高斯点绑定到物理引擎中的低维刚体状态,通过 GPU 批量向量操作在亚毫秒内完成同步,实现动态场景的低成本视觉更新。
  • 单模板批量广播:GPU 显存中只保存一份场景模板,并在最多 2048 个并行环境中广播,显著降低显存占用和带宽压力。

最终测试显示,在 RTX 4090 单卡上,GS-Playground 能以 640×480 分辨率渲染 2048 个并行场景,总吞吐量突破 10,000 FPS。与 Isaac Sim 的光线追踪渲染器相比,GS-Playground 在不同分辨率和多种 GPU 架构(RTX 4090、RTX 6000 Ada、A100)上均保持明显领先,而 Isaac Sim 在较高分辨率下更容易遇到显存溢出问题。

GS-Playground入选RSS 2026:万帧级3DGS视觉机器人仿真器解析

3. 自动化 Real2Sim:一张 RGB 图像生成仿真资产

为了降低仿真场景制作成本,GS-Playground 提出了一套自动化“Image-to-Physics”流水线。该流程只需输入一张 RGB 图像,即可生成可用于仿真的数字孪生场景。

整体流程包括:RGB 图像输入后,先由 Grounding-DINO 完成开放词汇检测,再通过 SAM1/SAM2 进行实例分割与迭代掩码扩张;随后使用 LaMa 进行背景修复;接着由 AnySplat 生成场景级 3DGS 表示,并结合 SAM-3D 完成物体级 3DGS 与 Mesh 重建;最后进行深度对齐、尺度校正与 Speedy-Splat 剪枝,输出完整仿真资产。

单张图像端到端处理时间约为 5 分钟。基于 Bridge-v2 数据集,团队进一步构建了配套的 Bridge-GS 数据集,为每个场景补充 3DGS 表示、物体 Mesh、6D 位姿和相机参数,展示了该流水线的批量生产能力。

从行走到抓取:GS-Playground 的 Sim2Real 验证

GS-Playground 还提供完整的多模态传感器栈,包括 RGB 相机、深度相机、三类 LiDAR(旋转式、固态、非重复扫描)、力/接触传感器和地形感知扫描。值得注意的是,它也是当前少数基于 3DGS 表示实现并行 LiDAR 仿真的平台之一。

在 API 层面,GS-Playground 兼容 MuJoCo MJCF 格式的完整子集,使已有 MuJoCo 项目能够以较低成本迁移到新平台上。

团队在多类具身任务中验证了平台的 Sim2Real 能力:

  • 四足行走:在 Unitree Go2 上,使用 1,024 个并行环境训练,策略约 10 分钟收敛,并成功部署到真实机器人实现速度跟踪。
  • 人形行走:在 Unitree G1 上,使用 2,048 个并行环境和全碰撞流形,23 自由度人形策略约 6 小时收敛。
  • 视觉抓取:在 Airbot Play 机械臂上,策略直接从 RGB 图像学习端到端 6 自由度关节控制,在真实场景中实现 90% 零微调成功率;作为对照,使用 MuJoCo、ManiSkill3 和 Isaac Lab 训练的策略在真实世界中成功率均为 0%。
  • 视觉导航:在 Unitree Go2 上采用分层强化学习架构,高层策略从第一人称 RGB 图像学习目标搜索与导航决策,低层策略输出关节级控制信号,仿真训练后可直接部署到真实 Go2,仅依靠机载摄像头完成目标导向导航。

GS-Playground入选RSS 2026:万帧级3DGS视觉机器人仿真器解析

意义与展望:让视觉强化学习进入规模化阶段

GS-Playground 的价值不在于某个单点模块的改良,而在于它把物理仿真、照片级渲染、自动化资产生产和真实机器人验证整合成了一套面向视觉机器人学习的基础设施。通过将照片级视觉反馈的计算成本降到可规模化水平,它让视觉强化学习有机会达到过去只有本体感知强化学习才能触达的训练规模。

团队表示,GS-Playground 将完整开源全栈框架及 Bridge-GS 数据集。未来,该平台还计划用于为 VLA(视觉-语言-动作)和 VLN(视觉-语言-导航)模型合成大规模视觉训练数据,并构建可扩展的机器人策略验证基准。

当然,当前版本仍有提升空间,尤其是在动态光照处理和柔性体仿真方面。团队已规划整合粒子动力学(PBD/MPIM)与高斯泼溅的方案,以支持更多非刚性交互场景。

对于正在布局具身智能仿真系统的研究团队和工程团队来说,GS-Playground 展示了一条清晰路径:未来的机器人训练平台不仅要算得快,还要看得真、接触稳、资产生成成本低,并且能够真正迁移到现实世界。

© 版权声明

相关文章

暂无评论

none
暂无评论...