北京人形拿下WorldArena“双冠”:Pelican-Unify 1.0如何验证具身智能大一统路线?
导语:北京人形登顶WorldArena双赛道,具身大一统路线迎来关键验证。
具身智能正在从实验室演示走向真实生产环境。近期,Figure AI人形机器人在物流传送带旁连续数十小时直播分拣包裹,引发全球关注:机器人依靠自身视觉系统完成识别、抓取和分拣,而不是简单复现固定脚本。这一案例说明,机器人正在进入“基于模型的端到端推理”阶段。

在这个转折点上,北京人形机器人创新中心(下称“北京人形”)公布了其具身大一统模型Pelican-Unify 1.0的最新进展:该模型登顶WorldArena权威榜单,EWM Score综合得分位列第一,3D Accuracy接近满分。更重要的是,北京人形此前发布的WoW具身世界模型已经在WorldArena Data Engine数据引擎赛道登顶,并获得Hugging Face官方重点推荐,后续被斯坦福、Physical Intelligence(PI)等顶尖团队引用。由此,北京人形成为全球唯一同时登顶WorldArena两大核心赛道的机构,拿下具身智能领域首个“双冠王”。

从榜单结果看,Pelican-Unify 1.0以66.03的综合得分位居榜首。WorldArena的评估覆盖视觉质量、运动质量、内容一致性、物理遵循、3D准确性、可控性等多项指标,考验的不是单一生成效果,而是模型对物理世界的综合理解与预测能力。其中,Pelican-Unify 1.0在3D Accuracy指标上达到98.12,接近满分。这意味着模型不只是能生成“看起来像”的画面,更重要的是能较准确地理解和重建空间几何关系,而这正是机器人进入真实场景执行任务的关键能力。

从“会回答”到“会做事”:智能体正在走向物理世界
2025年以来,智能体(Agent)成为AI行业最热门的方向之一。OpenAI、谷歌、Anthropic等公司持续加码,国内大模型厂商也几乎全部入局。智能体的核心目标很明确:让模型不再只回答问题,而是能够感知环境、制定计划、调用工具并持续执行任务。
在数字世界中,这套逻辑已经初步成立。例如,AI可以根据指令检索资料、生成代码、调用工具完成流程。但当智能体进入物理世界,问题会变得复杂得多。比如,一个机器人要完成“把桌上的蓝色零件放进右侧料箱”这个任务,它需要同时做到:
- 识别桌面上的物体、颜色、位置和障碍物;
- 理解自然语言指令背后的操作意图;
- 预判抓取、移动、放置后环境会如何变化;
- 生成精确到毫米级的动作序列,并根据反馈实时修正。
传统具身智能系统通常采用模块化架构:视觉模型负责看,语言模型负责理解指令,世界模型负责预测未来,动作策略负责控制执行。这种方式在工程上可用,但存在明显的“语义鸿沟”:不同模块有各自的内部表示,只通过接口传递压缩后的结果,一旦任务复杂、环境变化或出现未见过的组合情况,系统就容易失去一致性。
Pelican-Unify 1.0:北京人形的“具身大一统”模型
2025年3月,北京人形发布通用具身智能平台“慧思开物”,提出“一脑多能、一脑多机”的方向:希望让同一个软件系统在机械臂、轮式机器人、人形机器人等不同本体上兼容部署。经过一年多迭代,北京人形在2026年5月推出了“慧思开物”平台的首个大一统具身基础模型Pelican-Unify 1.0。

根据技术报告《Pelican-Unify 1.0: A Unified Embodied Intelligence Model (UEI) for Understanding, Reasoning, Imagination and Action》,该模型试图将理解、推理、想象和行动纳入同一个训练与表征体系中,而不是把几个专家模块简单拼接在一起。换句话说,它追求的“大一统”不是接口层面的流程整合,而是让模型在结构上共享表征,在训练中互相约束,并在同一优化过程中共同演化。
Pelican-Unify 1.0一经发布便在多个评测中给出强势结果:不仅登顶WorldArena,在8个VLM Benchmark中也取得同级别(4B以内)模型第一,同时在VLA评测RoboTwin中位居前列。它因此成为少数在理解、推理、想象、行动等维度同时达到顶尖水平的统一具身智能模型。
“大一统”具体统一了什么?
Pelican-Unify 1.0的核心判断是:具身智能要变强,不能只靠单点能力提升,而需要一个能让理解、推理、想象与行动相互约束的闭环。模型需要在理解任务时考虑行动可行性,在预测未来时考虑物理约束,在生成动作时服从语言目标与场景状态。
从架构上看,Pelican-Unify 1.0主要实现了三类统一:理解、推理和生成。工程实现上,它由两个紧密耦合的组件组成:
- 视觉-语言模型(VLM):承担统一理解与统一推理,基于Qwen3-VL 4B初始化。
- 统一未来生成器(Unified Future Generator,UFG):承担统一生成,基于Wan2.2-5B初始化的扩散Transformer(DiT)构建。

共享稠密潜变量:让语言、视频与动作使用同一“内在表征”
传统流水线中,每个模块都有自己的内部状态:视觉模块有图像特征,语言模块有token序列,动作模块有策略分布,世界模型有潜在状态。它们各自优化,彼此只交换压缩后的输出,这也是语义断裂的根源。
Pelican-Unify 1.0采用一个共享的稠密潜变量z来替代分散状态。语言推理、视频想象和动作预测的训练梯度都会作用在同一表征上。这意味着,模型不再只是让三个系统通过接口通信,而是在同一个表示空间中让推理、想象和行动彼此影响、共同进化。
统一编码器:把历史观测、动作和指令压入同一语义空间
模型输入是多模态上下文,包括过去时刻的连续观测帧、历史动作序列以及当前语言指令。这些信息会被统一编码到共享语义空间,而不是拆成多个平行分支分别处理。
在此基础上,VLM会生成一条思维链推理迹。这里的“思维链”并不是用于展示的事后解释,而是模型对任务意图、物理约束、未来结果和动作选择的中间表征。随后,VLM会将最后一层隐状态压缩成稠密潜变量z。这个z既要服务语言理解,也要被下游视频生成和动作预测的损失持续约束,因此必须同时编码“世界将如何变化”和“机器人该如何行动”。
统一未来生成器:在同一个扩散过程中生成未来画面和动作
统一未来生成器以z为条件,在同一个去噪过程中联合生成未来视频帧和低层动作序列。未来视频会先被压缩为潜变量,动作轨迹也会被归一化为连续表示。视频token和动作token经过各自输入嵌入后,共同进入同一个DiT主干网络。
在这个过程中,自注意力负责建模时序与空间依赖,交叉注意力负责注入由语言指令提供的任务语义,扩散时间步则调控整体计算。值得注意的是,DiT主干由视频和动作共享,只有输入嵌入和输出头是模态专属的。因此,视频token与动作token在生成过程的每一步都能相互感知、相互约束。
训练目标由三路损失共同构成:语言推理损失、视频流匹配损失和动作预测损失。语言损失使z对齐任务语义,视频损失要求z具备对物理动态的预测性,动作损失则把z锚定到可执行控制空间。三类压力共同作用,使推理、想象与行动的一致性在训练中自然形成。
第三方评测:统一模型并不意味着能力平均化
对于具身智能模型来说,架构设计是否优雅并不够,最终仍要看第三方评测表现。Pelican-Unify 1.0的结果显示,统一架构并没有让单项能力变得平庸,反而在多个专项任务上接近或达到顶尖水平。
在VLM评测中,Pelican-Unify 1.0在8个General / Embodied Benchmarks上取得64.7平均分,达到同级别SOTA水平。尤其在更具具身属性的Where2Place和PhyX评测上,相比基座模型分别提升28.2分和20.6分,说明统一训练不仅没有削弱通用多模态能力,还强化了空间理解、物理理解和行动相关语义。
在动作生成能力方面,Pelican-Unify 1.0在RoboTwin 50-task双臂操作基准上取得93.5%的平均成功率。50个任务中,有31个任务成功率不低于95%,15个任务达到100%。这些任务覆盖插拔、堆叠、交接等不同操作类型,结果显示该模型的执行能力已经与当前SOTA模型基本持平。
将这些成绩放在一起,可以看到一个重要结论:Pelican-Unify 1.0并非只是在概念上强调统一,而是通过结构性共享表征,让理解、推理、想象和行动在实际评测中互相增强。
从平台到硬件:慧思开物的产业化验证
要理解Pelican-Unify 1.0的意义,还需要把它放回北京人形“慧思开物”平台中观察。慧思开物由AI大模型驱动的任务规划“大脑”和数据驱动的端到端技能执行“小脑”构成,目标是在不同机器人本体上实现同一软件系统的迁移部署。
Pelican-Unify 1.0作为统一具身基础模型,为慧思开物提供了更底层的“认知内核”。过去所谓“一脑多机”可能只是调度层把多个专家模型串联起来,而Pelican-Unify 1.0希望实现的是同一个理解—推理—想象—行动回路在不同机器人本体上的自然泛化。
这一能力已经在真实硬件上得到验证。模型在UR5e工业机械臂和“天工”人形机器人上的工业控制面板操作任务中,在零样本泛化和组合任务评测中均超越模块化基线。特别是在组合泛化测试中,模型训练时只学习单个原子操作任务,没有见过组合版本;测试时却能够根据自然语言指令完成两段任务的连续执行。这说明模型具备一定长周期操作与组合泛化能力。
这种能力对应的是“先想象,再行动”的闭环:模型在训练中已经把原子动作映射到未来状态分布,因此当A阶段任务结束后,能够基于新的初始状态继续规划B阶段动作,而不依赖人工设计状态机或模块间显式通信。
产业落地方面,慧思开物也已从技术演示走向真实场景。2025年9月,搭载慧思开物的“具身天工2.0”进入福田康明斯发动机工厂,在无人生产线上完成料箱取放与搬运任务;同年10月,“慧思开物”SDK开放,面向高校与产业伙伴构建生态;在世界人工智能大会(WAIC)上,该平台还协调四个异构机器人完成多本体、多任务异步协作,展示了分布式具身智能体系统的协同能力。
北京人形的定位:从榜单领先到基础设施建设
北京人形成立于2023年,由京城机电、优必选、亦庄机器人、首程资本等共同发起。2024年10月,其获授“国家地方共建具身智能机器人创新中心”称号,确立国家级创新平台定位。2026年2月,北京人形完成首轮超7亿元市场化融资,投资方包括北京市人工智能产业投资基金、百度、东土科技等机构与产业方。
在硬件方面,北京人形于2026年2月发布新一代通用机器人平台“具身天工3.0”,这是行业内首个实现触物交互式全身高动态运动控制的全尺寸人形机器人。此次Pelican-Unify 1.0同时登顶WorldArena两大核心赛道,意味着北京人形在运动控制与认知智能两条线上都取得了阶段性突破。
更值得关注的是,北京人形并不只追求单个模型或单个榜单领先。其开源RoboMIND数据集、开放慧思开物SDK、联合高校建立实验室等动作,显示出其希望成为中国具身智能研发底座和基础设施提供者的意图。
结语:具身智能竞争进入“能否泛化”的新阶段
2026年的具身智能行业正在进入技术分层期。量产端,头部企业已跨过千台甚至万台交付门槛;资本端,国家大基金三期开始布局具身赛道,单轮融资纪录不断刷新;竞争端,百余家相关企业并立,行业关注点也从“能不能做出来”转向“能不能在未见过的真实场景中稳定好用”。
Pelican-Unify 1.0所回应的正是这个问题。它试图把大模型时代在文本世界被验证过的统一表征和预训练范式,迁移到物理世界:让理解、生成、推理和行动在同一表征空间中共同演化。WorldArena“双冠”并不意味着通用具身智能已经完成,但它确实为“大一统”路线提供了一次具有说服力的全球评测验证。接下来,真正的考验将来自更复杂的真实生产环境、更长周期的任务链,以及跨本体、跨场景的持续泛化能力。