首个端侧实时部署世界模型来了!20万小时人类视频,Being-H0.7推理快50倍

导语:Being-H0.7以20万小时人类视频为燃料,首创隐式推理世界模型,端侧实时部署仅需3.61ms/步,推理效率飙升50倍,全面掌握动态、流体、柔性操作。

引言:人类视频,具身智能的下一块拼图

在具身智能领域,数据来源长期由仿真、真机和人类视频构成“铁三角”。过去两年,行业重心从仿真数据转向大规模真机采集,但真机数据面临背景同质、场景封闭的瓶颈。此时,人类视频以其天然的多样性和真实世界对齐的特性,逐渐成为驱动模型泛化的关键燃料。4月14日,BeingBeyond(智在无界)发布具身世界模型Being-H0.7,基于20万小时人类视频预训练,首次将人类视频学习建立在“隐式推理”范式上,并在6项国际权威评测中取得综合第一,展示了在连续动态场景、流体、柔性物体及复杂物理交互中的突破性能力。

项目页面 | 论文下载

从1000到20万小时:人类视频路线的长期主义

2025年,行业仍沉浸在Physical Intelligence(PI)系列带来的真机数据热潮中,但BeingBeyond创始人、北京大学卢宗青教授却看到了数据工厂模式的先天局限:集中式采集导致样本多样性匮乏,模型难以泛化。几乎同期,NVIDIA在GR00T中提出“数据金字塔”框架,将人类视频置于塔底,作为规模最大、多样性最丰富的基础数据层。卢宗青团队于是将目光投向人类视频,他直言:“人类视频分布式采集带来的多样性,是集中式真机数采难以替代的,它更有潜力成为具身模型的核心燃料。”

基于这一判断,团队于2025年7月发布Being-H0,以1000小时人类视频为核心预训练数据,成功部署到真实机器人系统,开创了“人类视频驱动具身学习”路线。2026年1月,H0.5将规模推至1.5万小时,成为全球首个万小时级人类视频预训练模型,展现出跨本体、跨场景泛化能力。如今,H0.7进一步将人类视频总量提升至20万小时,全球仅有少数工作达到这一规模。

隐式推理:世界模型范式的新跃迁

与NVIDIA Cosmos Policy、DreamZero等视频生成式世界模型不同,Being-H0.7舍弃了“生成未来画面”的显式动力学建模。这类方法虽然可视效果好,但计算开销极高,无法实时部署,且2D图像生成难以精确建模流体、柔性物体等真实物理交互,容易停留在“视觉合理”而非“物理正确”。H0.7的设计更贴近人类的“物理直觉”——人类在高速运动中并不逐帧预测画面,而是依赖长期经验形成的快速判断。例如,运动员接乒乓球时,并不会想象球的每一帧轨迹,而是下意识挥拍。

为了赋予模型这种非想象式的快速判断力,H0.7在模型内部引入一块“思考空间”进行潜空间隐式推理。它将当前观察、任务目标和对未来的预测压缩到中间表示中,再由该表示统一指导动作生成。这种范式不仅显式建模计算成本,还能在20万小时人类视频的支撑下,内化物体运动规律、交互模式及失败边界,形成稳定的泛化能力。

实验结果证实了其优势:Being-H0.7在6项世界权威具身评测中综合第一,其中4项登顶全球榜首。更关键的是,这些能力已在真实环境中得到验证:它可以在高速传送带上完成动态分拣与上架,跟随移动容器精确倾倒,预测滑动物体轨迹并接取,在狭小空间内完成插入、定量倒液,甚至处理柔性物体。

全球首个端侧实时部署:打破世界模型商业化瓶颈

除了算法创新,BeingBeyond在工程化落地方面同样领跑。早在2026年1月,H0.5-2B模型就已在NVIDIA Jetson Orin NX(约75 TOPS算力)上实现实时部署,并经过长时间稳定性验证,至今国内鲜有团队具备同等能力。这背后是团队自研的一体化推理优化体系,覆盖模型量化、压缩蒸馏、CUDA算子编译及异步推理调度,打通了从训练到部署的全链路。

在H0.7上,优化被推向极致:平均推理延迟低至3.61毫秒/步,比业内效率标杆Fast-WAM快10倍以上,显存占用仅为同类方案的约50%。与Cosmos-policy、DreamZero等视频生成式世界模型相比,推理效率更实现50倍以上的提升。最具里程碑意义的是,团队首次在Orin NX端侧芯片上完成了世界模型的实时运行——这意味着,端侧算力、世界模型、实时运行这三个长期被视为“不可能三角”的维度,首次在同一系统中收敛。这一成就使Being-H0.7成为全球首个在消费级边缘算力上实时部署的世界模型,大幅降低了具身智能商业化的成本门槛。

数据闭环:驱动通用能力与专家能力的“两级跃迁”

从H0到H0.7,人类视频规模预计年底将扩展至100万小时量级,这为模型带来了高度多样化的真实世界分布,推动了“通用能力”的关键跃迁。然而,具身智能要真正落地,还需在具体场景中具备高精度的“专家能力”,这依赖高质量的第一视角数据采集。当前行业普遍存在数采与训练割裂的问题,卢宗青指出:“过去一年我们收集了大量外部数据,也经历过一次性丢弃数千小时数据的情况,数采体系仍处于早期阶段。”

为此,智在无界率先打通了“大规模预训练—数据采集”闭环。他们推出的BeingBeyond U1是全球首款Real DexUMI设备,能以无本体、低成本的方式在真实场景中同步采集视觉、动作与触觉等多模态信号,并将人手精细操作高保真映射至机器人灵巧手。相较于传统真机采集,U1的数据获取效率提升超过10倍,且“所采即所得”,无需重定向即可直接训练,显著降低了精度损耗。这一能力弥补了工业流水线等高精度场景的关键短板,使模型能快速掌握复杂装配、柔性交互等专家级技能,实际任务成功率提升至90%以上。

依托U1采集的高质量场景化数据,Being-H0.7完成了从“通用”到“专家”的能力跃迁:通用能力解决“能用”,专家能力决定“好用”。以20万小时人类视频为底座,叠加闭环数据体系注入的垂直场景能力,具身智能正迈过规模化落地的“最后一公里”。

结语:H0.7重塑具身模型赛道

Being-H0.7的意义不止于性能跃升,它重构了具身智能的落地路径。当世界模型首次在端侧实时运行,能力、成本与效率的不可能三角开始瓦解,具身智能真正步入可规模化复制阶段。这一突破的背后,是人类视频预训练驱动的通用能力底座、隐式推理带来的世界理解范式跃迁、以及数据闭环驱动的专家能力进化——三者叠加,使模型在开放环境中具备稳定工作的能力。当行业还在不同路径间反复试探时,智在无界用H0.7给出了一条确定性答案:以人类视频为核心燃料,以世界模型为中枢,以端侧部署为形态,打通从数据到行动的全链路。这不仅是模型的发布,更是具身智能从技术竞赛走向产业基础设施的分水岭时刻,竞争逻辑正在被重新定义。

© 版权声明

相关文章