CMU等团队破解3D场景物理难题!PAT3D让文生3D从
导语:PAT3D让AI生成的3D场景从”能看”进化到”能模拟能交互”,解决物理不稳定问题,推动3D AIGC落地。
现在的3D AIGC虽然能快速生成场景,但往往存在物体悬空、互相穿插、物理稳定性差等问题,无法直接用于游戏、XR或机器人等实际应用。针对这一痛点,来自卡耐基梅隆大学(CMU)、香港大学(HKU)和香港科技大学(HKUST)的研究团队提出了PAT3D(Physics-Augmented Text-to-3D Scene Generation),旨在让生成的3D场景不仅在视觉上合理,更在物理上站得住,可直接用于编辑、交互和仿真。该论文已被ICLR 2026接收。

PAT3D的核心思路:三步构建物理合理的3D场景
第一步:3D物体与空间关系抽取
系统根据文本提示生成一张参考图,利用视觉语言模型识别场景中的物体类别、材质和相对位置,并将图像分割成多个对象区域。随后为每个对象分别生成3D资产,确保后续每个物体都能作为独立刚体参与接触、碰撞和支撑关系计算。
第二步:布局初始化
先通过单目深度估计将2D参考图回投成粗略的3D布局,再根据视觉语言模型抽取的物体依赖关系构建层级化的“场景树”,描述沿重力方向的物理依赖(如“支撑”“包含”)。随后对初始布局进行两类修正:同层物体之间的水平去重叠,以及父子节点之间沿重力方向的垂直分离。这样得到的初始场景至少无穿插,适合进入物理模拟。
第三步:布局优化
引入libuipc的可微刚体仿真,使物体在重力和接触力作用下朝静力平衡状态演化。同时,根据最终模拟状态是否满足场景树中的包含与支撑关系,定义语义损失,反向传播优化初始位置,从而得到既稳定又尽量保留文本语义的场景。

实验结果:物理指标全面领先
在包含18个复杂提示词的测试中,PAT3D与GraphDreamer、Blender-MCP、MIDI等方法对比,关键物理指标极为突出:继续模拟位移为0,物体穿插比例为0,物理合理性评分高达88.5。在书本、杯子、餐具、积木、水果篮等复杂接触场景中,PAT3D能有效避免物体悬空和模拟后坍塌,减少摆放错位。例如积木堆叠场景,普通方法生成的布局容易倒塌,而PAT3D通过调整初始摆放,使最终稳定结果更贴近文本描述。

三大应用方向:从静态展示到真正可用
场景编辑
当用户删除或添加物体时,场景不会出现穿插或悬空,而是通过模拟重新达到平衡,使得3D内容创作像“搭积木”一样灵活。
动画制作
PAT3D生成的场景本身满足物理约束,无需手动修正即可直接用于动画制作,大大提高了传统物理仿真动画制作的效率。
机器人仿真
机器人训练需依赖物理准确的模拟环境。PAT3D生成的场景可直接导入模拟器,用于测试抓取、搬运等策略,提供大量可信的训练环境。
总结与展望
PAT3D不仅提升了3D生成的质量,更使其面向数字内容生产、机器人仿真等真实应用场景。该工作展现了物理仿真在3D生成中的巨大潜力,且其源代码已在Apache-2.0许可下开源,为社区进一步研究提供了坚实基础。