告别手脑脱节!卧安OneModel 1.7用一条隐式通路,让机器人看懂还能做对
导语:机器人在家总是“心有余而力不足”?卧安发布全新模型,给具身智能装上了灵巧互通的神经网络。
2026年,世界动作模型(World Action Model, WAM)彻底成为了具身智能领域的核心战场。从英伟达等芯片巨头到各类机器人初创公司,大家都在向这个方向源源不断地倾注资源。逻辑非常直观:要让机器人真正走进人类复杂的现实生活,它们必须具备两项底层能力——第一,理解物理世界各种复杂、动态的变化规律;第二,学会调动自己的钢铁躯体去精准地介入并改变这些变化。
然而,在行业狂飙的背后,一个长期悬而未决的断层始终横亘在所有人面前:为什么很多世界模型明明已经“看懂了”环境的细微改变,其动作策略在执行时却依然“做不对”?感知与物理行动之间,似乎隔着一条深邃的鸿沟。
针对这一痛点,卧安机器人(OneRobotics,6600.HK)最新发布的 OneModel 1.7 FrontoStria-RL 提供了一个极具代表性的系统性解法。它没有陷入单纯堆砌参数规模的传统军备竞赛,而是将突破口选在了一条连接世界理解与动作执行的隐式传导通路上——Predictive Policy Latent(预测策略隐式表征),并配合了一套能够持续自我进化的强化学习(RL)自适应闭环机制。
这一架构的实际效果在测试数据中得到了直接的体现:在学术界公认的LIBERO标准测试中,OneModel 1.7 刷新了行业天际线,取得了99%的平均成功率,一举超越了当下备受瞩目的 π0.5、GR00T-N1.5 以及 OpenVLA-OFT 等主流公开模型。而在更具挑战性的真机实测中,它也展现出了惊人的稳定性:日常操作平均成功率高达99%,容错空间极低的高精度操作成功率达到97%,甚至在与人类进行的高速乒乓球对打测试中,也实现了91.2%的接球成功率。

图 1:标准 LIBERO 平均成功率对比。One Model 1.7 领先于 π0.5、GR00T-N1.5、OpenVLA-OFT 等主流公开模型。
理解了却做不对?家庭场景对机器人的终极拷问
为了直观地理解这个问题,不妨想象一个日常且琐碎的家庭场景:机器人昨天在你家厨房里顺利地洗完了碗,并将碗盘平稳地收纳进了橱柜。然而,今天你把碗架稍微向右挪动了十几厘米,橱柜柜门也处于一个与昨天不同的微小开合角度。对于任何一个正常人类而言,这种环境变化根本不需要动脑思考,伸手就能适应。但对于机器人来说,这却意味着它面对的是一个充满未知变量的“全新任务”。
家庭环境是公认最难啃、也最具落地价值的硬骨头。这里没有两间完全一模一样的厨房,没有两个物项摆放完全一致的客厅,而且光照变化、物品材质的多样性,都在无时无刻不在给机器人的感知系统出难题。它不仅要处理洗碗、叠衣、整理房间这类的长流程多阶段任务,还要面对插拔试管、倒咖啡豆这种容错空间极小的高精度小微动作,甚至是接打乒乓球这样极度考验毫秒级响应的高动态极限场景。
从技术演进的路线上来看,当前行业的主流做法主要分歧为两条路径,它们各自面临着难以回避的结构性瓶颈:
- VLA(视觉-语言-动作)端到端路线:这类方案表现得很直接,即把摄像头捕捉到的视觉画面和人类的语言指令直接映射成机器人的电机控制指令。在训练数据覆盖极为充分的特定场景中,它的执行效率极高。但它的致命弱点也同样显著——一旦相机视角发生偏移、物体表面光照出现漫反射,或者面对多步骤组合的复杂长流程任务,它极易中途丢失全局目标,出现动作跑偏。
- 世界模型(World Model)路线:该路线试图建立一个更加稳健的思考模块,让模型去理解物理世界的运转规律、物品之间的空间遮挡关系,并推算动作执行后的可能后果。理论上它的泛化潜力更广,但现实落地时却遭遇了“脑手不协调”的尴尬局面。如果强制用它预测出来的显式未来图像或者空间三维坐标作为中间媒介去指挥动作模块,不仅会引入生成式AI常见的幻觉误差,还会带来高额的信息冗余与推理延迟。
说白了,世界模型自己“看懂了未来”,但没能把这份理解无损且即时地传递给底层的手脚。卧安这次祭出的OneModel 1.7,其核心任务正是去治愈这种“手脑脱节”的绝症。
解密FrontoStria:用隐式通路重建手脑链接
在卧安自研的 RL-LWAM(RL-Latent World Action Model) 架构体系中,模型的整体运作链条显得逻辑严密:从指令和环境观测出发,输入至世界模型,形成Predictive Policy Latent(预测策略隐式表征),进而协同 理解专家(Understand Expert)与动作专家(Action Expert),最终下达至底层硬件执行,最终依靠RL与成功记忆库形成闭环反馈。

图 2:One Model 1.7 FrontoStria-RL 完整架构。
在这套架构中,FrontoStria 这个极具生物感的名字非常值得探讨。它起源于神经科学中的“额纹状体通路”(Frontostriatal Pathway)——这是人类大脑中负责将高层认知抉择指令(如前额叶皮层作出的决策与长远规划)无缝传导到底层运动执行中枢(纹状体)的关键神经环路。卧安在其模型设计中借用了这一生理逻辑,让 Predictive Policy Latent 在整个计算图谱中扮演起了类似的通信桥梁角色,实现了把世界模型对场景宏观变化的深刻认知,转化为底层动作生成所需的指令输入。
传统的粗暴方案在试图连接两端时,往往倾向于生成具体的视觉画面或者目标参考坐标,但这就像是让人类在脑子中画出一幅精细的设计图再去握杯子,效率低且容易画错。而 Predictive Policy Latent 选择了一条极为巧妙的隐式路子:
- 在训练阶段:模型被允许获取机器人执行动作之后的“未来观测状态”。系统正是利用这一过程,让模型自发去塑造动作结果对环境产生改变的深刻物理推演能力,从而自发提炼出精简的隐式推理向量。
- 在部署执行阶段:系统果断切断了对“未来信息”的依赖,机器人只需面对当下的即时画面,就能在内部自发调制出等效的三维感知调制信号。
这种设计意味着,这套隐式传导机制巧妙地用未来轨迹训练了当下的直觉,既消除了生成多余视觉帧所耗费的计算算力和幻觉误差,又保留了空间感知的高密度信息。可以说,这也正是 OneModel 1.7 区别于传统拼凑型架构最深层的技术内核。
自适应进化的武器:RL闭环与越用越聪明的成功记忆
打通了神经通路,固然能让机器人的动作变得更聪明,但在危机四伏的真实物理世界里,长尾效应(Out-of-Distribution)无处不在。机器人的动作一旦受到外力推拉跌趔、或者机械手指发生了磨损,仅靠离线训练好的参数很难做到万无一失。
为了赋予机器人生长与适应的能力,OneModel 1.7 的第二个核心亮点在于其代号中的 RL(强化学习)闭环机制。它让机器人在日常任务的实机交互中,能够基于明确的任务评分指针、主被动安全防护红线以及人在环路(Human-in-the-Loop, HITL)的实时监督,不断进行策略微调。这种设计不仅打破了传统模仿学习“触碰不到示范数据天花板”的天然局限性,还让机器人在不断的现实碰撞中自己去摸索出更快速、更合理的轨迹动作。
与此同时,卧安开创性地提出了一种 Retrieve-then-Steer(检索与自引导) 计算机制。通常的学术评估习惯把每次测试均设定为从零开始的未知独立实验,这与机器人在现实中的部署环境出入极大。事实上,家庭机器人往往是在一个长期稳定的封闭空间里反复作业——昨天烘干衣服成功了,今天衣服的物理性状并无二致。这种成功的轨迹,就是最天然、最宝贵的特异性操作经验。
这一机制的落地包含四个环环相扣的步骤:
- 存储阶段:当机器人在日常运转中成功跑完一次任务,其对应的时序动作片段和多模态环境数据,会被以轻量化的形式完整沉淀在机器人的本地长期成功记忆库(Success Memory)中。
- 检索阶段:当新的相似指令到来时,系统会迅速调动向量检索机制,去匹配库中曾经成功过的关键动作轨迹片断。
- 过滤阶段:依托强大的轨迹级一致性算法,剔除其中逻辑不一致的噪音点。
- 引导阶段:将沉淀下来的动作先验信息自适应地嵌入到 flow-matching(流匹配)动作生成器的核心采样状态里,根据历史相似度的置信区间强弱,动态微调对其的牵引度。
这种方法能够让机器人在不重新训练整个深度网络模型的前提下,在日常的高频交互中变得原来越轻巧灵便、长久部署表现更加稳键。

图 3:SimplerEnv 平均成功率对比。Retrieve-then-Steer 将测试基准的平均成功率拉升了 3.7 个百分点。
强劲基线背后的支撑柱:Understand Expert 与 MCF-Proto
Predictive Policy Latent 的隐式高速路在真正承载重载流量时,离不开两个在通路中后段负责打基础的基础层保障。
第一是承担任务中枢分解职责的 Understand Expert 与技能(Skill)体系。真实的家政任务大多繁琐漫长:叠被子需要先将四角摊平,然后顺势横折,最后进行边缘规整。这些具有强依赖性的结构化操作工艺,单纯依靠空间建构和底层的机械臂微操都是很难应付的。Understand Expert 会在隐式信号调制下,精细化剖解步骤,将长途任务折叠成可以复用的独立经典子技能流(Skill Sequence),确保机器人在长链路交互下不会“健忘”。
其二,则是针对动作执行头(Action Head)的致命改造——MCF-Proto(运动中心局部框架算法)。市面上绝大多数VLA的端到端架构,都是在固定的全局世界坐标系下预测电机数据。这样的设定就像是把机器人的眼睛焊死了,只要相机稍微偏了几度,或者起步姿势差了公分,机器人就会挥空空。而 MCF-Proto 会识别任务中的核心形体线(如滑轨、折叠中线、插销孔位),自发构建起一个 Motion-Centric Action Frame(以动作为核心的局部运动框架)。

在这个动态构建的坐标体系内,动作的生成序列被优雅地压缩为一组高度共性的基本手势动作原型(Prototype)。测试数据证实,在面临相机角度变化和机器人初始身位偏移的非标准扰动测试中,MCF-Proto 展现出了对几何扰动的卓越抗性,分别比业内强效基线高出了 3.3% 和 15.7%。这一差异完美消解了因视角细微错位导致的抓空与触碰倾斜故障。

图 4:LIBERO-plus 扰动鲁棒性对比。MCF-Proto 在相机视角变化(Camera)和机器人初始位姿偏差(Robot)两类几何扰动下优势显著。
具身模型格局的横向审视
如果我们跳出技术细节,把 OneModel 1.7 FrontoStria-RL 放到当前世界顶尖的具身智能开源生态和商业进展中去横向推敲,某些显著的设计差异便跃然纸上:
π0.5 和 GR00T 等业内模型,目前很大程度上依然深度依赖离线的高保真模仿数据或生成式图像作为任务过渡。而卧安所选择的隐式表达通路的精妙之处,正在于其摒弃了计算负荷巨大的中间图画推理层,用更接近物理世界本质规律的低维稠密特征连接起了“前额叶决策”和“运动肌肉反应”,并且配合强化自适应算法(Retrieve-then-Steer),让机器人在非参数化的轻量模式下就能不断在真实家庭中变乖、变聪明。
从实验室中令人振奋的Demo演示,过渡到真刀真枪、高度不确定的家庭生活服务场景,这绝对是一场全方位的系统级考验。单纯指望以力降人、无脑堆叠算力参数的模式正在显露它的实用性局限;一套能够有机统领通用泛化力、高精准空间抗扰与自我更新潜能的闭环框架网络,才是把机器人平稳送入千家万户的破局所在。从这个角度来看,专注于把世界模型融会贯通到机械臂末梢的卧安 OneModel 1.7,确实给我们探索具身智能与现实融合指明了一条极具启示性的进化路径。
相关学术论文与详情已被卧安官方以及 arXiv 等学术平台公开披露:
- 论文1链接:https://arxiv.org/abs/2605.11809
- 论文2链接:https://arxiv.org/abs/2605.10094
- 卧安机器人官方详情页:https://www.onerobot.com/OneModel


