击落泡沫与PPT!极佳视界“双金字塔”体系面世,百台家庭人形机器人已跑通数据闭环
导语:极佳视界发布“双金字塔”软硬一体架构,携100台真机进驻社区,正加速跑通物理AGI进化链路。
具身智能的发展正进入深水区。在过去两年的行业演进中,从业者们的目光主要聚焦于两类技术路径的交锋:一派是以NVIDIA Cosmos、Google Genie为代表的“生成式世界模型”,试图通过算法模拟物理世界的动态来扩充数据;另一派则是以Physical Intelligence的π系列、Diffusion Policy等为代表的“动作派”,主张依靠庞大的真机物理反馈数据来喂养神经网络。这两条路线虽然都在高速迭代,但在根本上都没有回答一个底层逻辑——当我们在探讨通用物理智能(物理AGI)这个宏伟长远命题时,究竟需要什么样的软硬件生态和数据吞吐体系,才能稳定托起这条赛道的“Scaling Law”?
在武汉光谷举办的物理通用智能技术发布会上,极佳视界(GigaAI)抛出了他们对这一瓶颈的系统性解答。
在这次发布会中,极佳视界亮出了五张扎实的底牌:世界首个物理AGI“双金字塔”体系;家庭通用智能品牌“拾光 SeeLight”及首台通用人形机器人“拾光 S1”;国内首个在真实社区(光谷之寓)落地实施的百台级机器人部署项目;计划于第三季度亮相的下一代重构新品“拾光 S2”;以及针对未来12个月发布三代基础模型(GigaBrain-1、2、3)的大模型路线图。这一系列动作,最终指向的都是那个被行业反复讨论的物理AGI“GPT-3时刻”。
底层解构:制约物理AGI跑通Scaling Law的真实壁垒
要看懂极佳视界的这套架构体系,我们需要先理解当下具身智能赛道的核心痛点。极佳视界合伙人兼研发副总裁叶云指出,目前的产业瓶颈可以拆解为两个层面。
首先是数据侧的质量与规模困局。真机数据具备绝佳的动作精度,然而其采集成本极高、规模难以实现指数级扩张;来自互联网的海量视频虽然丰富,但其中包含的物理交互信息并不带有机器人可以直接利用的隐式动作控制信号;依靠数学公式与三维建模运行的仿真数据虽然能无限量产生,但无法轻易跨越从虚拟到现实(sim-to-real)的物理屏障。依靠任何单一条线的尝试,都无法提供支撑大模型持续膨胀的优质数据源。
其次则是算法侧的表征缺陷。在现有的多模态架构下,大部分方案依靠语言模型为底盘(即VLA范式),直接把视觉信息和动作指令强行转换为token塞入LLM。然而,以文字处理见长的架构,天生就不擅长编码三度空间中的精细几何关系、物理因果链条以及绝对连续的操纵轨迹。这就好比用写文章的思维去指挥杂技表演,输入再多的教程,也难以演化出流畅的高难度动作。
针对这两大行业痛点,极佳视界给出了一套高度咬合的双螺旋结构:一个是数据金字塔,一个是算法金字塔。两座金字塔在物理与虚拟空间中相互咬合。这是目前行业内少有的将Scaling Law拆解为具体工程路径的系统化尝试。
数据金字塔:五层全能矩阵突破“数据荒”
在这套框架中,数据金字塔自下而上延伸:底层是互联网海量视频,向上依次为真人日常交互数据、世界模型仿真数据、数字仿真合成数据,而塔尖则是最珍贵的真机物理实拍数据。

在工程落地中,数据源的分层讨论很常见,但极佳视界的特别之处在于将每一层的数据收集硬件或工具,都实现了自主研发与落地:
- 塔尖真机层:由“拾光 S1”轮臂机器人与低成本真机数采硬件“Maker M01”协作完成,直接沉淀高保真的真实家庭执行反馈。
- 过渡仿真及生成层:利用自研生成式物理世界模型平台“GigaWorld-0”,大规模生产符合真实世界动态规律的多维训练样本。
- 真人示范层:依靠低维护门槛的便携手持数采硬件“U-01”与轻量级第一视角数采设备“E-01”,直接捕捉人类日常的动作习惯。
- 公域基础层:调用全球公开的大规模视觉数据集,提供最初始的常识感知学习能力。
通过这种低成本、不绑定具体机型的无感数据收集硬件(类似顶尖学术界探索的方向),极佳视界成功把机器人软硬件研发中开销最重的数据壁垒,转化为了能流水线作业的模块化工程。
算法金字塔:三维递进与全球权威基准的三冠王
算法金字塔的设计则更加聚焦,分为底层的世界模拟、中层的动作对齐与顶层的经验强化。这三个梯度分别对应着不同的自研模型群,并且全部在国际公认的评测基准上面试刀。
在底层的世界模拟中,自研模型“GigaWorld-1”在具身大模型评估标杆WorldArena上拿到了62.34分的综合成绩,在评测平台上超越了Wan、CogVideoX、Veo 3.1以及Cosmos-Predict等众多强手,也是首个跨过60分大关的同类物理世界模型。
在中层的动作对齐部分,极佳视界采取了具身基础大模型“GigaBrain-0”与动作大模型“GigaWorld-Policy”的双线交融方案。在专注于真机物理测试环境的RoboChallenge基准上,前者取得了51.67%的动作执行成功率,超出行业标杆π0.5近十个百分点;而在面向细腻家庭实操的RoboCasa365评测里,后者同样力克英伟达GR00T N1.5与π0.5,成为首个在此场景中登顶的世界动作模型。
最上层的经验强化则搭载了具备自我进化能力的模型“GigaBrain-0.5M*”,通过高频的“环境演化 + 强化学习”循环,使得智能体能不断实现算法逻辑的自我进化。
这三项独立的全球第一,本质上打通了从虚拟拟真、真机控制到多样化场景泛化的闭环路径。在目前的具身智能公司中,能有技术实力同时在上述三个维度霸榜并打通数据流转的,目前国内几乎仅此一家。
把实验室推向真实社会:百台机器人的常态化测试
技术体系被拉通之后,另一个严峻的问题接踵而至:这些复杂的模型怎么在现实中被评估?如果只是待在经过严密清理的工业车间或演示沙盘里,测试出来的场景适应度往往漏洞百出。
为了应对这一实战痛点,极佳视界联合创始人兼首席科学家朱政博士宣布成立面向真实家庭场景的独立品牌——“拾光 SeeLight”,并推出了轮臂通用人形机器人“拾光 S1”。
相对于路径相对单一的物流仓库或者流水分拣线,家居场景因为充满了非结构化的日常用品、时时变动的物理布局以及复杂的人机交互,向来被视为具身智能终极考核的修罗场。敢于一上来就啃最硬的骨头,倒逼软硬件演化,展现出了这家技术公司在顶层逻辑上的自信。
让人关注的,不是纸面的设计数据,而是一份已经落地交付的商业合同:极佳视界目前已签下针对武汉光谷之寓社区的100台通用机器人部署订单,并确定于第三季度开始进入常态化社会运营。此举意味着研究人员将能从小批量测试中抽身,真正开始面对真实且庞大的用户家庭物理操作链条。这对于物理智能Scaling Law理论而言,是至关重要的原生自产数据闭环。
同时,面向后续可用性的硬件重构方案“拾光 S2”也随之曝光。在收集了家庭反馈后,极佳视界针对性地缩减了60%的底座体积,使得机器人能够顺利穿梭于家庭局限的过道和房门之间;电池储能也实现了70%的手动热插拔替换能力,使得连续工作时间呈倍数延长;操作高度也提升到了2.2米。这显然是一套冲着日常真实“工具属性”去设计的务实工程路线。
12个月后的期末考:物理智能的“涌现”时刻是否真能兑现
发布会最核心的节点,在于其抛出的一张12个月无保留路线图:极佳视界计划连续迭代三代基础大模型体系。
这一进度的终局,是定于未来披露的基础模型GigaBrain-3。该模型将部署超1000万小时真实级人类日常视觉数据,以及超100万小时的世界-动作对齐数据。这个近乎天文数字的数据体量,目标指向的就是物理通用智能领域的“GPT-3时刻”。
回顾深度学习的发展脉络,GPT-3的划时代意义并不单单是参数量的扩增,而是其率先揭示了当数据与模型空间碰触到物理临界点时,原本僵硬的控制流程会自动涌现出前所未见的逻辑常识与多模态泛化能力。物理通用智能也面临同样的拐点:在算法五层双塔搭建好之后,当真实家庭的数据闭环规模突破一定数量级,纯粹由指令喂养的机器人,会不会表现出人类级别的自主常识?
面对这个悬而未决的技术争论,极佳视界没有选择跟随用长远且模糊的承诺来遮掩核心研发卡点,而是以清晰的物理机制、多维度的全球评测跑分,以及可供全行业考察的动态量产方案和真实社会节点予以回应。在接下来的12个月中,数据闭环的有效性、百台机器人的日常跑通成色,以及大模型的升级表现,都将一一接受大考。


