仿真到现实无损迁移!国产GPU如何用「造世界」解决具身智能最大痛点?

导语:摩尔线程推出国内首个全栈国产具身智能仿真平台MT Lambda,从“做芯片”跨入“造世界”。

在前沿科技圈,大家都在卷大模型和减速器硬件。但做过机器人开发的同行心里都清楚一个极大的痛点:机器人在现实世界里试错,成本高得让人肉疼。大模型可以靠互联网上海量的文本和图文喂饱,但具身智能要吃的是三维世界的动作反馈和物理法则。靠人手去采集数据、靠真机去摔打折腾,不仅效率低得像牛车,硬件损耗也难以承受。

正因如此,虚拟仿真成了具身智能的数字母胎。最近,一家国产GPU厂商在整场发布会中,几乎没花时间发布新的计算卡,而是聚焦于一件非常物理、极需硬核算力的事情:推出了国内首个全栈国产化的具身智能仿真平台——MT Lambda。

发布会现场,一只名叫“小飞”的机器狗缓缓走上舞台。屏幕那头,虚拟世界里的数字小狗做了一个轻巧的侧空翻;而在台前,物理世界中的真狗在同一时间复制了相同的动作。这种仿真到现实的无损迁移(Sim-to-Real)能在全国产化算力平台和端侧芯片中跑通,确实给国内机器人研发链条提了口气。

【全栈国产仿真平台落地】具身智能Sim-to-Real方案

拆解MT Lambda:一条全栈式的物理AI训练流水线

把这个名为MT Lambda的平台拆开来看,它其实并不是个单一的软件工具,而更像是一条围绕机器人训练展开的闭环流水线。这套系统在架构上分工很明确,主要由两层组成:

  • MT Lambda-Lab(策略层):主攻具身智能的脑部训练。无论是强化学习、模仿学习,还是当前前沿的VLA(视觉-语言-动作)大模型,机器人的动作怎么学、策略怎么迭代、如何在复杂多变的环境下保持动作稳定,都在这一层完成。
  • MT Lambda-Sim(物理层):专注于高保真物理仿真和渲染。机器人眼中的世界真实度、抓取物体的质感反馈、环境中光线和传感器的模拟,都由这一层进行大规模数据生成和仿真验证。

【全栈国产仿真平台落地】具身智能Sim-to-Real方案

从数据合成、策略训练,到仿真验证、端侧部署,整个链路一气呵成。它的底层内核则由物理、渲染、AI三大引擎撑起:

物理引擎部分,MT Lambda集成了开源的MuJoCo-Warp-MUSA、Newton-MUSA后端,并接入自研的AlphaCore物理引擎。多核MUSA架构进行并行求解,带来了并行物理计算的大幅加速,在常见仿真负载测试下,整体吞吐效率相比之前提升了约30倍。这也意味着,机械臂指尖触碰物体时的受力反馈,或者四足机器狗在泥地、沙地等不同材质路面上的姿态调整,都能在虚拟世界里被快速并准确地算出来。

渲染引擎则是机器人的路况导航仪。MT Lambda搭载了MT Photon光子引擎,结合了光线追踪、三维高斯泼溅(3DGS)以及AI生成式渲染。当传感器和摄像头模拟出的图像越逼真,真实渲染带来的合成数据就越接近现实世界,算法在真机上翻车的几率就越低。以主流卡型MTT S5000为例,得益于其硬件级RT Core,光追辅助下的图形渲染能力可实现近3倍的性能增幅。

【全栈国产仿真平台落地】具身智能Sim-to-Real方案

AI引擎这边,通过深度适配PyTorch的Torch-MUSA核心框架,加上muSolver、muFFT加速库,让VLA大模型的多模态输入处理得更加顺畅,也把强化学习的训练范式无缝衔接了进来。

为什么全功能GPU能把“算、仿、渲”装进一个盒子?

很多人可能会有疑问,为什么是做GPU的企业跑出来搞仿真平台?

原因其实就在“具身智能的复合需求”上。机器人训练的门槛高,逻辑极其繁杂:要训练动作模型(AI矩阵计算),要模拟复杂的碰撞、材质和接触面动力学(科学计算/物理AI),要输出无限接近照片级的传感器图像(3D渲染),还要高频录制、传输、解码各种训练视频(超高清视频解编)。

【全栈国产仿真平台落地】具身智能Sim-to-Real方案

只偏好某一类通用AI任务的专用加速芯片(如TPU或纯算NPU),在面对这种高度混杂、需要渲染和物理拟真并行算力的场景时,往往会捉襟见肘。开发者以前常常处于分裂状态:跑模型在一套卡上,搞物理模拟又去接别的物理计算工具,数据频繁在不同的软硬件环境里倒腾,接口难调,延迟还高。

而全功能GPU的单晶片同时涵盖了AI计算、图形渲染、科学计算以及视频编解码,MUSA统一架构正好把这些繁琐的中间桥梁抹平了,实现一站式的“算、仿、渲”一体化。对于开发者来说,终于可以不用每天和底层驱动对抗,能够放手去调优算法本身。

云、端、生态的落地验证,不能只谈账面数据

一个好的产业级平台,只做软件是撑不起来的,还得有云端、端侧和第三方生态共同闭环。摩尔线程对此给出的打法是:

云端算力底座:夸娥(KUAE)千卡智算集群。集群核心显卡MTT S5000(基于平湖架构)拥有1000 TFLOPS的FP8算力、80GB显存以及1.6TB/s带宽,是国内稀缺的能跑大模型训推、又自带硬件光追加速的显卡。当百万级仿真数据需求暴增时,这里就成了大批量数据出厂的超级流水线。

端侧控制大脑:长江SoC和MTT E300 AI模组。云端千锤百炼出来的越野策略或操作技能,最终要压缩并下放到端侧,让边缘端的模组去本地实时决策。E300具有50 TOPS的算力,能够部署在机器人底盘或胸腔包内,支持几十毫秒内的动力反馈控制,实现了算力的云端闭环。

【全栈国产仿真平台落地】具身智能Sim-to-Real方案

在生态落地上,国内的多家主力厂商也给出了早期的脱水测试数据:

  • 在与北京智源人工智能研究院的联合实测中,机器脑智脑模型RoboBrain 2.5在MTT S5000千卡集群下跑完了全流程,其训练Loss曲线与海外顶级H100集群的拟合度极高,误差仅0.62%,且在64卡向1024卡规模平移时表现出超90%的线性加速比。
  • 与自动驾驶世界模型厂商光轮智能的合作中,光轮的多物理场高精度求解器成功适配了MUSA平台,可以实时高精度模拟刚体、柔体及流体等颗粒变化,物理参数仿真准确率超过99%。
  • 在自动驾驶独角兽小马智行的世界模型训练中,MTT S5000和集群为其每周生成达百亿公里的海量极端越野/特情仿真路面数据,大大缩短了系统对Corner Cases(长尾极端路况)的学习时长。

纵观整个行业,从单纯的“卖一块算力芯片”,演进到“卖一整套打通了物理仿真和AI训练的基础设施”,这个转变表明国产GPU的战场已经向前挪步。虽然距离整个具身智能产业链彻底成熟仍有不少技术壁垒要啃,但国内的全栈国产化平台已经踏出了实锤性的第一步。

© 版权声明

相关文章