10亿元融资、Object Trajectory中介:RoboScience用VLOA大模型破解具身智能泛化难题
导语:RoboScience获10亿元融资,VLOA大模型用Object Trajectory解耦认知与执行,实现跨本体泛化,抓取成功率94.83%。
AI 科技评论独家获悉,具身智能领域的明星创业公司 RoboScience 机器科学于近日完成 10 亿元 A 轮融资,投资方涵盖多家国内外知名产业巨头及一线财务机构。本轮资金将用于深化其核心的 VLOA(Vision-Language-Object-Action)大模型技术,并推进自研机器人本体的工程化与量产,加速通用具身智能方案的规模化落地。
据悉,RoboScience 新一轮融资也已接近完成,投资方包括互联网产业资本、国家队基金及顶级财务机构。在 2026 年具身智能从实验室走向产业化的关键节点,该公司正以独特的 VLOA 架构向行业通用难题——泛化性——发起挑战。
具身智能的“泛化鸿沟”:为什么传统方案行不通?
当前机器人操作方案多采用“一机一策”,即针对特定场景、特定物体、特定机器人编写单独的代码或训练单独模型。这种接近工业自动化的方式在动态复杂场景中表现脆弱:换一个物体、改一个环境、甚至换一种抓取姿态,模型往往需要重新训练。这种缺乏泛化性的现状,严重制约了具身智能从实验室走向规模化产业应用。
VLOA 大模型:用 Object Trajectory 搭起认知与执行的桥梁
RoboScience 的技术路线聚焦于机器人与物理世界交互的本质。团队自主研发的 VLOA 大模型由“具身世界模型”与“通用操作模型”深度融合而成,目标是打造一个适用于任何任务、任何对象、任何机器人的跨实体通用具身智能系统。
VLOA 的核心创新在于引入 Object Trajectory(物体轨迹) 作为高层语义与底层物理规律的解耦中介。具体来说,系统以物体的连续 3D 点云轨迹进行表征:上层的具身世界模型负责认知和预演物理轨迹(例如“杯子需要被拿起并移动到桌角”),下层的通用操作模型则负责将该轨迹转化为不同机器人本体的精确物理控制信号。这种解耦使得模型可以分别利用海量互联网视频(训练世界模型)和仿真数据(训练操作模型)进行预训练,无需依赖真实机器人实体的昂贵数据采集。
RoboScience 构建的具身世界模型以物体交互为中心,面向三维动态场景。它并不渲染“宏大世界”或像素级视频,而是专注于物体级状态、三维轨迹、接触关系、物理因果变化等机器人操作所需的底层表示,与通用操作模型和执行层形成统一闭环。相比当前以视频预测为主的世界模型路线,该架构更接近真实执行需求,实现了 跨物体、跨任务、跨场景、跨机器人本体 的通用泛化能力。
数据规模:千万小时视频与万亿次轨迹
具身世界模型基于海量互联网视频进行预训练。通过全自动数据标注与清洗 pipeline,RoboScience 已积累数百万小时以物体为中心的高维多模态操作数据集(数千万 video clips),并以每周数十万小时的速度增长,目标在 2026 年构建上千万小时的全球领先数据集。
通用操作模型则通过“物理引擎—仿真数据—端到端训练”的高效闭环来学习物理规律。该模型支持刚体、铰链体、1D/2D/3D 可形变体等全空间物体的各类操作任务;支持跨本体(不同类型的机器人及末端执行器);支持闭环操作;支持含视觉、触觉、力觉的多模态感知。目前模型已在自研多模态物理引擎中积累了数百亿次高质量 manipulation 操作轨迹数据集,2026 年目标超过 1 万亿次。
技术验证:ICRA 最佳论文与 94.83% 的跨智能体抓取成功率
RoboScience 的核心技术已在顶级学术会议得到验证。以抓取操作为例,团队首席科学家邵林带领的研究组有两项重要成果:
- D(R,O)Grasp——通用灵巧抓取框架:创新性地构建了机器人与物体的交互统一表示,使得同一个 AI 模型可以支持多种不同的灵巧手进行抓取操作。该工作荣获 ICRA 2025 机器人操作与运动最佳论文奖,是近 5 年亚洲地区唯一获此奖项的研究。
- T(R,O)Grasp——最新研究已入围 ICRA 2026:该操作大模型参数量超过 10 亿,支持 5 FPS 的实时动态交互,并在多种智能体上取得了平均 94.83% 的抓取成功率,刷新了跨智能体灵巧抓取的全球 SOTA。
这些成果表明 VLOA 架构不仅理论上可行,而且在实际性能上已领先业界。
自研本体即将发布,加速落地闭环
据可靠消息,RoboScience 将于近期发布自研机器人本体,为 VLOA 大模型在真实世界中的规模化落地提供物理载体。这意味着公司将从“纯软件大模型”向“软硬一体”方向迈进,强化技术验证与商业交付能力。
RoboScience 致力于构建全球领先的具身智能大模型及本体产品,未来将推动机器人广泛应用于零售、物流、工业与家庭等领域,提供安全、智能的解决方案。

总结:具身智能的“安卓时刻”还有多远?
RoboScience 的 VLOA 大模型通过将“世界认知”与“操作执行”分离,用 Object Trajectory 作为统一接口,在数据利用、泛化能力和硬件适配方面开辟了一条新路径。10 亿元融资和即将发布的本体,表明其正从论文走向产品。如果 VLOA 架构能够持续积累高质量数据并保持技术优势,或许将成为具身智能领域的基础平台之一——一个跨机器人、跨场景的“具身智能操作系统”。当然,数据规模扩大的效率、真实场景的鲁棒性、以及商业落地的成本控制,仍是未来需要面对的挑战。