双榜登顶、四项全能:Motubrain如何为机器人大脑设定“干活”新标准?
导语:Motubrain双榜登顶,解析机器人通用世界行动模型的核心能力与落地前景。
“机器人都能做后空翻、跑马拉松了,怎么还是干不了活?”在有关具身机器人的视频评论区,我们总能看到这样的疑问。的确,纵观行业当前的大部分具身机器人,在尝试“干活”的时候总会遇到尴尬场面:要么一次只能干一件事,一点都不“通用”;要么经常卡顿,需要人为干预;要么换了个机型,就动不了了。这不禁令人疑惑:具身智能离真正帮我们干活,到底还有多远?
很多人把具身机器人干不了活,归咎为模型能力不足。但事实并非如此——人们想交给具身智能来干的活千千万万,包含复杂操作和简单动作,按照目前行业顶尖模型的能力,未必不能胜任。一个被忽视的问题是,大家对于“干活”的定义没有统一,究竟做到什么程度才算“能干活”?评价机器人干活的综合能力,又要看哪些方面的表现?
这种背景下,国际权威Benchmark榜单的参考价值被进一步放大。不久前,通用世界行动模型Motubrain同时登顶WorldArena与RoboTwin2.0两大国际具身智能权威榜单,其背后的生数科技也渐渐浮出水面。Motubrain的双榜登顶,为机器人大脑的干活能力确立了参照系,也为具身智能的场景落地注入了更强的确定性。
双榜登顶:机器人干活能力有了“合格线”
WorldArena榜单聚焦模型对真实世界的理解与预测能力,核心衡量模型对物理规律、运动变化、环境状态的认知水平。在该榜单中,Motubrain总体EWM Score达到63.77,位列总榜第一,同时在Motion Quality、Flow Score、Motion Smoothness等多个核心运动维度均拿下榜首。
RoboTwin2.0榜单则聚焦机器人的任务执行与泛化能力,衡量模型在多任务、多环境、随机扰动下的稳定执行表现。Motubrain在Clean与Randomized两个场景下分别取得95.8与96.1的成绩,位列总榜第一,也是榜单上唯一一个在随机环境下平均分超过95的模型。
过去,行业内的技术探索大多存在能力偏科。部分模型在世界建模维度表现突出,但无法转化为稳定的执行能力;部分模型能完成固定动作,却无法适配环境的随机变化。极少有模型能同时在世界理解与动作执行两个核心维度做到行业顶尖水平。Motubrain展现出远高于VLA的多任务泛化性曲线和数据scaling曲线:随着任务数量增加,Pi-0.5成功率持续下降,而MotuBrain成功率持续上升——这说明它学到了跨任务的通用世界知识,这是VLA不具有的能力。同时,Motubrain的数据效率极高,仅用少量数据就可以取得很好的结果,且任务数量的scaling law曲线比数据量更为陡峭,说明增加任务多样性比增加数据量对成功率提升更显著。

机器人“干活”需要哪些模型能力?四项全能解析
既然有了参照系,就不可避免地要回答:机器人落地“干活”,到底需要哪些模型能力?参考人类干活所需的能力,可以归纳为四个维度:
一脑多能:通用性
餐馆工作人员需要身兼数职,机器人也需要一个“大脑”接管所有岗位。Motubrain在多任务场景中能保持稳定表现,且随着任务数量增加,模型共享到的世界知识越多,平均任务成功率反而同步提升,任务之间不再争夺模型容量,反而相互促进。在生数科技发布的真机演示Demo中,Motubrain在“调酒”任务中能抓取不同大小、材质的容器,将酒一滴不撒地倒入酒杯,也能抓取薄荷叶这类柔性物品。
一脑贯通:连贯性
“倒杯水”这个简单指令背后其实是一长串任务:抓取杯子、从厨房取一杯水、避开地上杂物、识别卧室门口、放在床头柜上且不打翻药瓶……传统做法依赖上层任务拆解、状态机或快慢系统拼接,每一步都可能引入额外延迟和失败风险。Motubrain能直接学习完整任务链路,无需上层规划拼接,人类无需中间反复干预。它可以完成超过10个原子动作的复杂长程任务,如Demo中的“插花”,包含多次捡花、插花以及拿起水壶喷水的动作,整个过程十分丝滑,像一个整体而非分解动作。
一脑预见:预测能力
像网球这类运动,球速往往在每小时100km以上,超过当前机器人硬件能力上限,等感知到球再挥拍已来不及,必须在人击球时做出预测。Motubrain是将理解世界、预测世界和执行动作统一建模的模型,能推演环境变化并据此生成更合理的动作路径,预测球路和驱动身体挥拍成为同一模型下的两种推理模式,延迟更低,决策更连贯。
一脑多型:泛化能力
机器人形态各异,构造无法保持一致。Motubrain从一开始就面向多机器人本体,用统一的action表征打通不同本体,适配轮式、臂式、复合式等多种形态。随着机器人种类和场景不断增长,模型通用性持续提升,又进一步反哺每一类机器人的实际表现。
技术基石:UniDiffuser统一建模与WAM范式
为什么Motubrain能同时具备这四种能力?最根本的原因在于其训练范式——通过UniDiffuser统一建模和调度video与action两个连续模态。一次训练,即可推理出五类分布:视觉-语言-动作(VLA)、世界模型、视频生成、逆动力学、视频-动作联合预测。这种大一统建模带来的直接结果是数据吸收能力的质变:传统VLA只能从特定机器人本体的完整任务轨迹数据中学习,而Motubrain可以同时利用缺少action模态的纯视频数据、缺少语言任务标签的任务无关数据,以及包含video、action、language的完整轨迹数据。模型学到的,是任务、环境变化和动作后果之间的共享世界知识,这也是多任务正向scaling的根基:任务越多,共享的世界知识越丰富,模型平均成功率随之提升。
Motubrain并非“横空出世”,早在2025年12月,生数科技就开源了Motus,比行业早两个月提出并验证了World Action Models的核心思想。在Motus基础上,Motubrain完成了五步跃迁:用任意视角数量的统一建模打通不同相机配置;用统一的action表征打通不同机器人本体;通过自回归+diffusion和语言-动作-视频三流MoT,实现超过10个原子动作的长序列任务;让超大规模具身模型能够在机器人上实现云边端协同的实时闭环控制。这五步让Motubrain从一个学术验证型框架直接切入了高要求的干活场景。
从技术验证到产品落地:真正的挑战
做出一个能干活的模型只是第一步,下一步是把这种干活能力升级为产品力。生数科技在多模态领域已有Vidu产品经验,其全自动一键成片、高质量批量生产视频的能力广受好评。这表明技术领先固然重要,但把技术转化为客户愿意付费的产品,考验的是对真实场景需求的理解和商业化路径的探索。生数科技已开始前置布局:2026年3月,公司在2026中关村论坛年会上正式发布通用世界模型战略,以基座世界模型为核心底层,向上延伸出两条业务轨道——基于世界生成模型的Vidu(数字空间)和基于世界行动模型的Motus(物理空间)。在物理空间产业化上,生数科技已与无界动力、星尘智能、深朴智能等具身智能企业达成战略合作,形成了“模型能力—本体适配—场景落地”的完整闭环。
结论:具身智能离“能干活”还有多远?
说“近”,是因为像Motubrain这样在世界建模和执行能力上同时站上行业最顶端的模型正在出现。双榜第一的意义不仅仅是技术指标的领先,而是第一次为通用机器人大脑在落地之前竖起了一把标尺——我们知道了什么样的模型能力至少具备了在真实场景中干活的潜力。说“远”,是因为从模型突破到大规模部署之间,还有大量工程化问题和产品化工作要做:机器人不只是模型,还要适配不同本体的硬件,适应千差万别的物理环境,形成用户端真正好用的产品体验。但至少过去几年困扰行业的最大瓶颈——机器人大脑缺乏统一、通用的智能能力——正在被一步步突破。2026年的具身智能行业,正在从“技术验证”走向“规模落地”的关键节点上,而Motubrain的出现,可能是其中最值得关注的一个信号。