一张RGB图实现室内3D语义理解:港科广团队LegoOcc入选CVPR 2026口头报告
导语:港科广团队提出LegoOcc,仅凭单张RGB图像实现室内开放词汇3D占用预测,突破无需3D语义标注的限制,成果入选CVPR 2026口头报告。
把机器放进一个从未见过的房间,它仅凭一张普通照片,就能理解哪里是墙、哪里是桌子,甚至能听懂“找一下椅子下面的拖鞋”。这正是港科大(广州)陈昶昊团队给室内空间智能带来的突破。他们的工作 LegoOcc 被 CVPR 2026 接收并入选口头报告,首次在不使用任何3D语义标注的情况下,仅靠单张RGB图像实现了开放词汇的室内3D占用预测。对于家庭机器人、护理辅助和 AR/VR 而言,这意味着机器对室内环境的理解正从“看见物体”迈入“理解空间”。

室内3D感知:比自动驾驶更棘手的开放世界
自动驾驶虽复杂,道路结构和交通参与者相对规范,而室内环境更像一个持续变化的开放世界。物品摆放随时变动,遮挡关系密集,大量物体并不属于预定义类别。若想让模型真正理解三维空间,传统方法需要昂贵的3D语义标注——逐点或逐体素标明每个位置属于什么物体。这种成本很难支撑机器人在家庭、办公等场景大规模部署。
陈昶昊团队直面这一瓶颈,提出 LegoOcc,其论文《Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes》挑战更贴近真实应用的情境:仅使用一张普通室内RGB图像,不依赖多视角、深度图或激光雷达,也不使用3D语义标签,预测空间占用并支持自然语言的开放类别查询。
核心突破:从“固定类别识别”到“开放词汇理解”
LegoOcc 不把任务局限在“椅子、桌子、墙”等固定类别,而是要求模型根据自由文本查询鞋子、纸张、垃圾桶、背包等长尾物体。训练阶段仅使用二值占用标签(告知模型“这里有东西”),语义能力则通过开放词汇的2D分割模型与语言特征对齐获得。
在 Occ-ScanNet 数据集上的结果显示:开放词汇设定下,LegoOcc 达到 59.50 IoU 和 21.05 mIoU。对比现有开放词汇基线,POP-3D 为 35.32 IoU / 5.96 mIoU,LOcc 为 36.70 IoU / 9.25 mIoU,LegoOcc 在几何占用和语义理解上均有大幅提升,其中 mIoU 从 9.25 跃升至 21.05,语义识别能力突破显著。即便与使用完整3D语义标签训练的闭集方法(如 TPVFormer、GaussianFormer、MonoScene、RoboOcc 等)相比,LegoOcc 在完全不使用语义体素标注的情况下,仍以 59.50 的 IoU 超越了所有闭集方法的几何占用指标。虽然语义 mIoU 仍低于闭集最强的 RoboOcc(47.76),但考虑到零语义标注的前提,这已是令人瞩目的进步。
方法内核:带语言特征的高斯表示与泊松占用转换
LegoOcc 的核心中间表示是携带语言特征的三维高斯——它同时编码了几何信息(位置、形状、大小、透明度)与语义信息(与文本对齐的向量)。几何与语义统一绑定在同一表示中,不再需要“先预测结构再贴标签”。
为从高斯映射到三维占用,团队设计了 基于泊松建模的高斯到占用转换。将每个高斯视为对空间某处存在物体的“证据”,多个高斯重叠时,证据自然累积决定该位置是否被占据。相比简单的伯努利方法或直接叠加,这种设计更稳定,解决了透明度在多高斯情况下的语义特征对齐难题。消融实验显示,伯努利方法仅获得 46.65 IoU / 17.25 mIoU,而泊松方法达到 59.50 IoU / 21.05 mIoU。
训练时,几何分支通过二值占用监督和深度约束学习空间结构;语义分支则借助开放词汇2D分割模型(如 Trident)从图像提取语言对齐特征。模型先将高斯的语义特征渲染回二维平面,再与分割模型提供的特征保持一致,从而在不依赖任何3D语义标注的情况下完成语义学习。
渐进式温度衰减:平息特征混合
室内场景极易出现“特征混合”:一条视线上可能同时穿过椅子边缘、桌腿和墙面,多个高斯的语义被加权融合到同一像素,导致三维空间中的语义边界模糊。为此,团队提出 渐进式温度衰减策略。训练初期采用较高温度,使特征融合较为平滑,模型先稳定学习整体场景结构;后期随着温度指数式降低,让重要高斯的贡献更尖锐,不相关高斯被抑制,每个高斯获得更清晰的语义归属。实验证明,指数衰减效果最优,固定低温和训练/测试温度不一致都会导致性能下降或崩溃。

速度快、预测完整:22 FPS 的实时潜力
在单张 RTX 4090 上,LegoOcc 推理速度达到 22.47 帧/秒,远超 ISO 的 3.81 fps、EmbodiedOcc 的 11.48 fps、POP-3D 的 10.21 fps 和 LOcc 的 8.93 fps。紧凑的高斯表示使其无需复杂后处理,在速度与精度间取得出色平衡。可视化结果也表明,相比基线 LOcc,LegoOcc 对墙体、地板、家具等结构的预测更加完整连续。

自然语言查询:看懂“鞋子”“纸张”等任意词汇
训练完成后,LegoOcc 可直接根据自然语言进行三维查询。输入文本类别后,模型将其转换为语言特征,与三维空间中每个被占据体素的特征进行匹配,从而定位对应物体。查询类别不限于训练集中出现的 11 个固定类,背包、自行车、窗帘、鞋子、纸张、垃圾桶等均可被稳定识别。这一能力让未来的机器人能够真正听懂指令:“去门边把那个蓝色背包拿过来”,而不再局限于预设的物品清单。
降低门口:让大规模3D语义理解走向实用
LegoOcc 的“二值占用学几何+二维开放词汇模型监督语义”范式,极大降低了构建三维语义系统的标注成本。室内物体类别长尾且频繁变动,逐点标注几乎是不可规模化的。该工作证明,借助成熟的2D视觉语言模型,单目相机即可带来接近闭集方法的几何性能,同时赋予模型开放语义理解能力,为家庭服务机器人、AR室内导航等应用铺平了道路。
当然,方法仍有局限:开放词汇语义 mIoU 仍低于全监督闭集方法;依赖2D分割模型的质量,单目深度歧义依然存在;不同文本提示(如“椅子”“座椅”“办公椅”)可能影响查询稳定性。但无论如何,LegoOcc 是从固定类别识别迈向灵活语言交互的关键一步。
研究者简介
第一作者周常青,香港科技大学(广州)博士生,专注于高效稳定的三维场景理解,以及端到端轨迹生成与导航世界模型。通讯作者陈昶昊,港科大(广州)智能交通学域和人工智能学域助理教授、博士生导师,具身智能PEAK实验室独立PI,牛津大学计算机博士。其研究聚焦具身智能和自主系统,曾入选全球前2%顶尖科学家榜单,主持多项国家级项目,在 NeurIPS、CVPR、ICCV、ICRA 等顶会发表论文50余篇。实验室主页:https://changhao-chen.github.io/
