北大发布 RealAppliance:100 个高保真家电资产,让仿真家电“真”运转起来
导语:北大董豪团队在 CVPR 2026 上发布 RealAppliance,通过100个高保真家电与真实说明书对齐,将基于说明书的操作规划评测推向新高度。
在具身智能迈向真实家庭场景的路上,家电操作一直是块难啃的骨头。相比桌面物体,微波炉、烤箱、洗衣机等设备不仅拥有按钮、旋钮、门体等异构部件,还受到模式切换、状态约束和程序逻辑的共同支配。机器人要完成任务,必须同时“看得见”“读得懂”“按说明书做对”。然而,这类基于说明书的操作规划能力,恰恰最难在真实环境中系统评测——误操作轻则损坏设备,重则引发安全风险,而真实家电价格高、品类多、维护复杂,难以支撑大规模可重复实验。更关键的是,现有仿真资产普遍缺失说明书对齐与程序逻辑,无法满足说明书驱动评测的需求。
针对这一瓶颈,北京大学董豪团队(高玉正、龙宇星等在董豪老师指导下)在 CVPR 2025 Highlight 工作 CheckManual 的基础上,进一步提出 RealAppliance 数据集与 RealAppliance-Bench 评测基准,首次实现了“真实说明书、高保真资产与操作逻辑”的系统对齐,将基于说明书的家电操作规划评测推进到更贴近真实世界的设定中。这项工作已被评为 CVPR 2026 Highlight。

RealAppliance 收录 100 个精细建模的家电资产,覆盖微波炉、电热水壶、搅拌机、烤面包机等 14 类常见电器,并为每个资产配套真实说明书。这些资产不仅在外形尺寸上忠实还原,更在关键部件功能、交互机制和程序状态转移上与真实产品保持一致,从而为机器人操作研究提供了可重复、可扩展的仿真实验对象。

从数据到逻辑:一步步让电器“活”起来
RealAppliance 的构建并非简单的三维建模,而是遵循“数据采集、资产建模、机制配置、程序设计”四个阶段,在外观、结构、交互和状态逻辑四个层面同时逼近真实电器。

1. 严选数据来源
研究团队从多个国家和地区系统收集家用电器及配套用户手册、实物照片,并按照四项标准筛选:部件尺寸适合机械臂操作;手册篇幅适中,匹配当前多模态大模型的上下文能力;描述清晰,部件名称和操作步骤有明确说明;信息完整,包含尺寸数据和高分辨率照片。这保证了资产来源真实、信息充分,为后续部件命名、机制设计和任务标注提供了统一依据。
2. 高保真数字资产建模
资产建模的难点在于既要复刻真实外观,又要把关键操作部件拆解为可计算、可交互的结构单元。团队使用 Autodesk 3ds Max 对每款电器精细建模,所有功能部件均作为独立组件处理,并通过 TurboSmooth 提升细节。随后借助 Unfold3D 展开 UV 贴图,在 Photoshop 中绘制彩色纹理,还原表面颜色、图标和 Logo 等细节。
在 NVIDIA Isaac Sim 中,模型以 USD 格式导入,统一采用右手坐标系和几何中心原点,部件命名严格遵循说明书术语。同时通过材质参数调节,呈现玻璃、塑料、金属等不同表面效果。关节设计则根据部件运动方式分为三类:旋转关节(旋钮、铰链门)、棱柱关节(机械按钮、滑块)、固定关节(触摸按钮、屏幕)。
3. 物理与电子双重交互机制
为了让仿真资产具备与真实电器一致的交互响应,团队设计了一套模块化机制体系,所有机制封装为独立类并遵循统一接口,可按需组合。其中包含 5 种物理机制:内部弹簧(如烤面包机杠杆自动复位)、磁吸(如洗衣机门吸附)、机械触发(如开门按钮联动弹出门)、旋钮倒计驱动(如空气炸锅定时旋钮)、安全锁(如搅拌机机头锁);以及 5 种电子机制:屏幕显示(实时更新纹理)、触摸感应、照明、指示灯和旋转马达(如微波炉转盘)。这一体系让电器资产从“可见”的三维模型进化为具备可操作反馈与状态变化的仿真实体。
4. 植入程序逻辑
基于上述机制,研究团队为每个电器编写了与真实说明书一致的程序脚本。脚本首先定义电源、温度、时间、模式等核心状态变量及其取值范围,再为各功能部件绑定相应机制,最后依据说明书中的操作顺序、条件约束和状态转移关系设计整体程序逻辑。这样,资产在参数变化时能够触发屏幕显示、电机启停、照明变化等联动效果,较完整地复现真实电器的工作流程。
RealAppliance-Bench:五步递进,评测模型的真实家电操作力
围绕机器人完成一次完整电器操作所需的核心链路,RealAppliance-Bench 设计了五个递进任务,覆盖从文档理解到执行纠错的关键环节,系统评估模型在电器操作规划各阶段的能力。

- Task 1 – 手册页面检索:要求模型根据给定手册,从完整文档中准确检索出指定类别的页面(如“操作步骤”)。这验证模型的文档理解与信息筛选能力,因为电器手册通常包含部件说明、操作步骤、安全须知等多种信息,而操作规划最依赖的是部件说明和操作步骤。
- Task 2 – 开环操作规划:给定任务指令(如“制作爆米花”)、电器手册和初始观测图像,模型需要规划出一系列原子动作序列。基准定义了 9 种电器操作动作(按下、旋转、打开等)和 4 种物体操作动作(拾取、放置等),要求模型从候选动作中选择正确类型并补全参数。
- Task 3 – 电器部件定位:开环规划只输出部件名称,真实执行却需要精确空间位置。本任务要求模型结合手册内容与部件名称,在当前观测图像中预测对应边界框,以评估其跨模态部件对齐能力。
- Task 4 – 闭环规划调整:真实执行中常出现门被意外打开、旋钮被扰动等情况,模型需依据实时视觉反馈及时修正后续动作。基准预设固定扰动类型和位置,要求模型在给定历史执行记录、初始计划和实时观测后,预测下一个正确的原子动作。
- Task 5 – 全过程推理:模型需依次完成手册检索、开环规划、部件定位,并在执行过程中应对外部干扰。任一步骤失败(如部件定位 IoU < 0.5 或动作预测错误)都将导致整体任务判定失败,因此该任务能直接反映模型的端到端鲁棒性。
实验结果:主流模型集体“翻车”,具身智能任重道远
研究团队在 RealAppliance-Bench 上系统评测了多类主流模型,包括专有多模态模型(GPT-5/GPT-5 Mini、Gemini 2.5 Pro/Flash)、开源多模态模型(Qwen3-VL 系列、GLM 系列)以及具身规划模型(Robobrain 2.0、ManualPlan、ApBot)。结果显示,尽管不同模型在局部任务上各有优势,但面对真实说明书驱动且与家电程序逻辑对齐的操作规划链路时,整体表现与可靠应用水平存在明显距离。
- 手册页面检索:专有模型整体最优,开源模型次之,具身规划模型相对较弱。这说明具身模型在当前训练范式下尚未形成稳定的文档理解能力,甚至可能在任务特化过程中被削弱。
- 开环任务规划:所有模型均未展现出令人满意的稳定性,常见错误包括动作类型误用、目标部件选择错误和关键步骤缺失。这表明模型尚未真正掌握说明书驱动的操作逻辑,尤其缺乏对条件依赖与步骤顺序的深层理解。
- 部件定位:模型预测的边界框 IoU 普遍偏低,多数结果仅在 0 到 0.05 之间。其根本难点在于,模型需要将手册中的示意图或符号化部件描述与真实观测图像中的跨视角视觉线索进行对齐,这对空间理解与视觉指向能力都提出了更高要求。
- 闭环调整:模型普遍难以根据状态变化及时修正计划。其中,参数预测错误(如旋转角度不准确)是仅次于动作类型错误的第二大失败来源,这说明模型既欠缺对细粒度视觉变化的稳定感知,也缺乏将感知结果转化为后续决策的能力。
- 全过程推理:几乎所有模型的端到端成功率均为 0。误差在多任务链路上的级联放大,凸显出当前系统在真实电器操作场景中仍然缺乏足够的鲁棒性与闭环执行能力。

总结与展望
RealAppliance 首次在家用电器场景中实现了“真实说明书、高保真资产与操作逻辑”的系统对齐,并将基于说明书的家电操作规划评测推进到更接近真实世界的设定中。它构建的 RealAppliance-Bench 为研究者提供了一条从文档理解、动作规划到闭环修正的完整测试链路,也更清晰地揭示了当前模型在关键环节上的能力边界。随着这类高保真资产与评测体系不断完善,家庭服务机器人在复杂家电场景中的可靠部署将获得更加坚实的基础。未来,RealAppliance 不仅可继续作为说明书驱动家电操作评测的标准化平台,也有潜力支持低层家电操作策略与高层家电操作模型的后续研究。
论文地址:https://arxiv.org/abs/2512.00287 | 项目主页:https://realappliance.github.io/ | 数据集地址:https://github.com/gaoyz1235/RealAppliance