ICLR 2026|英伟达提出Scenethesis:四阶段Agent系统,将文本生成3D场景的碰撞率从6.1%降至0.8%
导语:英伟达与普渡大学提出Scenethesis,用Agent闭环将文本生成3D场景的碰撞率从6.1%降至0.8%。
大模型正在从“会说会写”走向“会规划、会执行”的Agent时代。对具身智能来说,这种变化尤其关键,因为真正限制机器人和智能体能力上限的,往往是现实世界中过高的试错成本。一个物理合理、结构真实、能够支撑交互和仿真的3D世界正变得越来越重要。

从一句文本描述直接生成一个真正“能用”的三维场景,远比生成几张好看的图片更难。一个场景是否可用,不仅取决于里面有没有桌子、椅子和书架,还取决于这些物体之间的关系是否合理:杯子能不能放在桌面上,书能不能被摆进书架里,椅子是否面向符合使用常识的位置,整个空间会不会出现穿插、漂浮和不稳定支撑。换句话说,3D场景生成最难的地方是让空间关系真实,并能够服务于交互、仿真和具身智能任务。
围绕这一问题,英伟达Cosmos Lab与普渡大学的研究者提出了Scenethesis(ICLR 2026)。他们换了一个思路:把语言、视觉和物理约束组织成一个可以自我迭代的Agent闭环系统,让文本生成3D场景不再是一次性的“生成”,而是一个不断规划、检查、修正的过程。

可交互三维场景生成的两个长期困境
过去几年里,可交互3D场景生成大致沿着两条路线发展。第一类方法依赖3D-FRONT等室内数据集训练模型,在室内布局上取得进展,但能力被训练分布锁住:难以泛化到室外场景,也无法稳定处理“小物体放置于大物体中”这类细粒度空间关系。另一类方法借助大语言模型做开放式布局规划,语言模型组合能力强,但运行在符号空间里,不在几何空间里,导致结果常出现椅子朝墙、物体浮空甚至彼此穿插等违反常识的现象。
Scenethesis:四阶段Agent系统
Scenethesis是一个无需重新训练场景生成模型的系统框架,包含四个阶段。
第一阶段:语义模型进行粗粒度规划
系统先根据文本提示识别场景类型、挑选关键锚点物体,并构建初步的层级布局。这一阶段输出选中的物体以及扩充过的场景描述(JSON格式)。

第二阶段:视觉模块进行空间落地
系统生成参考图像,通过实例分割和深度估计恢复场景结构,估计物体的初始3D大小,将语言描述转化为更贴近真实世界的空间线索。

第三阶段:物理参与生成过程
Scenethesis采用有符号距离场(SDF),进行细粒度的几何对齐与物理约束,让优化过程直接考虑接触、支撑和稳定性,显著减少漂浮、穿插和不稳定现象。
第四阶段:自检与修复机制
系统最后加入judge模块,对物体类别、空间关系和整体结构进行一致性判断。如果场景未通过检查,系统重新规划和修复。实验显示:第一轮生成通过率约72%,引入自检机制后提升至91%。
实验结果:空间关系更真实,物理更合理
论文显示,加入这套闭环后,场景生成的碰撞率从6.1%降至0.8%,同时能更稳定地处理上方、内部、下方等丰富的空间关系。该方法未被室内数据分布锁死,在海滩、街道、公园等户外环境中也能生成结构自然、物理可信的可交互场景。对于虚拟内容创作、仿真环境搭建以及具身智能训练来说,这提供了可操作、可编辑、可反复试验的空间环境。
Scenethesis与其他方法生成的场景对比
只需一段文字描述,Scenethesis就能生成对应的可交互三维场景。
当然,Scenethesis并非终点。它仍受资产库多样性、遮挡场景下对应精度以及可动结构资产支持能力的影响。但这项工作提供了一种有代表性的方向:当文本到3D变成由语言、视觉和物理共同驱动的闭环过程,我们才真正开始逼近“可交互世界生成”的核心。对于走向空间智能和具身智能的大模型来说,这或许更接近下一阶段真正重要的问题。