拒绝对齐固定模板!清华与VAST用策略梯度赋予3D生成“自适应智商”,算力从此告别粗暴平摊

导语:VAST与清华团队在SIGGRAPH 2026提出DeG算法,打破传统高斯静态刚性模板,实现低成本算力适配。

关注3D AIGC领域的开发者可能会发现,虽然模型“生成一个具体物件”的能力已经今非昔比,但渲染和计算流水线上依然隐藏着一个尴尬的死角:生成资产的复杂度往往是铁板一块,极度缺乏灵活性。做图形学的人时刻计较着怎么把有限的计算预算花在刀刃上,而游戏、XR等需要落地到端侧的场景,则急需同一个3D物体能自适应地派生出高质量和轻量级两种版本,而不是每次都为不同的终端规格重新训练或生成一套模型。

这背后暴露的,正是目前主流3D生成方法普遍缺乏“预算分配常识”的行业通病。以这几年风头正劲的3D高斯表示(3D Gaussian Splatting)为例,到底哪里应该密一点、哪里可以稀疏些,很多模型并没有真正学到精髓,多数时候只是在用死板的固定模板去套用生成。近日,清华大学与VAST合作的一篇入选SIGGRAPH 2026的论文《Generative 3D Gaussians with Learned Density Control》,给这种低效的生成机制带来了一种自适应的破局思路。

从“刚性分配”退场,3D高斯的灵活性遭遇硬着陆

为什么3D高斯渲染此前能迅速红遍图形学和AI界?核心在于它在渲染速度与画质保真度之间找到了精妙的平衡,避免了传统网格繁琐的拓扑优化。在标准的3D高斯单物体拟合优化中,有一套不可或缺的机制——空间密度控制(Density Control)。在拟合过程中,算法会自发地在几何结构复杂、边缘以及突变纹理处增加高斯球的密度(即密集化),而在变化平缓、没有太多细节的空旷区域做减法(即稀疏剪枝)。

理想状态下,这种非均匀的布局最为高效。然而,这套被实践证明极度合理的“动态增删”机制,本质上是离散且不可微的启发式清洗过程。对于直接通过单张或多张图像进行前馈预测的Diffusion等生成式模型来说,这种不可微的过程根本无法直接参与端到端的网络训练。为了迎合神经网络的优化胃口,很多前沿的生成框架不得不退而求其次选择向“硬编码模板”妥协:

  • 部分方法选择将高斯分布强行限制并对齐到固定的体素网格上(如GaussianCube);
  • 部分工作选择给每个固定的空间格子强行塞入等量的高斯球(如TRELLIS.1);
  • 还有一些方法则根据2D像素阵列映射预测固定规模的高斯参数(如LGM)。

不可否认,如此妥协固然能换来方便的训练过程,但代价是彻底割裂了3D高斯原本最引以为傲的“弹性和灵活性”。三维物体在平坦墙面和繁复花纹上耗费的算力完全对等,形成了极大的资源浪费。

概率采样的“魔术”:同款资产如何实现按需伸缩?

为了拯救这种僵硬的表示形式,VAST与清华团队在这项工作中提出了全新的“密度采样高斯”(Density-Sampled Gaussians,简称 DeG)概念。它的核心思维在于:既然直接预测每一个点的坐标是僵硬的死办法,那不如退后一步,让网络去预测这套高斯点在三维空间中的概率密度分布

这带来了一种颠覆以往的推理自由度:模型输出的不是一份最终的固定点云坐标,而是一个可以灵活采样的概率磁场。在这个磁场里,磁性越强的地方代表着几何结构越丰富,越有必要在生成时多安排一点高斯球参与渲染。推理阶段的开发人员可以根据部署的目标机器性能,随时决定在这张图里采样多少个点。

【高斯算力减半新突破】VAST清华发布DeG三维生成技术

这带来了两个极佳的工程红利:

首先是任意数量的动态采样。 因为预测结果并不是写死的点集,所以开发者在运行时不需要针对低保真度或高保真度单独训练模型。需要极限流畅度的VR头设或移动端,可以主动选择采样较少的高斯点;而算力宽裕的工作站端渲染,则可以直接成倍采样,挖掘底层的极致画质。这属于一次生成,无限向下适配。

其次是高度自适应的非均匀采样。 相比于过往在空中乱撒点的做法,DeG会把有限的采样配额聪明地向尖锐边缘、极薄的物理结构和明暗纹理突变的位置倾斜,对于纯色或者开阔的大平坦面则高度克制射点。这对于低算力预算部署显得极其关键,能直接在底层拔高性价比门槛。

【高斯算力减半新突破】VAST清华发布DeG三维生成技术

用策略梯度打破“不可微”死穴:将高斯优化改写为强化学习

这个美妙的逻辑构想在实现上面临着图形学公认的巨大障碍:点的位置是从分布里“采样”出来的,而采样过程是离散且不连续的。这让反向传播算法遇到了死胡同——渲染所产生的画质误差,无法顺着离散的采样节点逆向传导回最初的概率生成器。模型只知道渲染结果画错了,却没办法追究“该把哪个区域的概率调高或调低”。

为此,论文团队创造性地开辟了一条通路:把渲染误差转化成强化学习中的惩罚与奖赏,构建了名为“渲染损失贡献梯度”(Render Loss Contribution Gradient)的优化范式。这与强化学习中的策略梯度(Policy Gradient)算法有着异曲同工之妙。

【高斯算力减半新突破】VAST清华发布DeG三维生成技术

这种梯度反馈机制极其自然且具有说服力。假定当前采样出了一批高斯点,我们尝试在其中玩一场“剔除游戏”:随机把某个点抽离出去。如果抽走它之后,该物理区域的画面重构精度雪崩,证明这个点在这里立下了悍马功劳,具备极高的边际贡献(Difference Reward)。系统便会立即重重地“奖赏”这个采样的概率区间,告知网络下次在大致相同的位置继续增加采样密度;相反,如果拿掉某个点对最终画面的渲染几乎没有任何影响,系统则会惩罚它的多余努力,收紧该位置的分布概率。

当然,要精细计算每一个高斯球的贡献,如果真要采用穷举“剔除-重新渲染”的暴力手段,计算量必然爆炸。对此,作者针对常用的L1渲染损失函数,设计了非常节省计算开销的闭式计算策略。渲染器在正常的单次前向传导过程中,就已经连带捕获了计算贡献所需的所有关键中间参数。不需要重渲染,直接在一个Pass中就能算出海量高斯球各自的绝对贡献。原本不可触碰的操作瞬间变为了端到端可微分的数学优化算法。

效率对决:用不到一半的高斯点,打平Sota渲染性能

从实验结论来看,这种将密度选择权完全托管给渲染损失的策略,取得了极其直观的效果突破。在一系列严谨的前馈式单图3D生成任务对照实验中,DeG表现出了极高的数据转化率。

【高斯算力减半新突破】VAST清华发布DeG三维生成技术

当我们将高斯球的总预算压缩到极低的水平时,DeG的优势尤其显著。在对比TRELLIS和UniLat3D等业界主流模型时,在相同画质细节的测试基底上,DeG仅需使用这几款传统模型一半以下甚至更少的高斯球点数,就能实现相近乃至更胜一筹的综合视觉呈现。这在实际的算力和网络带宽资源消耗上,基本意味着一半的存储和渲染能耗下降,彻底扫清了高性能3D资产在端侧落地的拦路虎。

重开思路的未来:3D资产的“活体表示”

跳出具体的技术路线和模型测试,DeG最引人遐想的,可能是改变了人们对“高质量”与“低质量”三维数字资产关系的基本定义。

在传统的游戏和影视工业中,所谓的“高模”和“低模”通常被视为两份互不干涉、各自打包的立档文件。但以DeG为锚点的全新视角提醒我们:物体的本质形状原本就是连续且唯一的,变化的仅仅是不同场景下算力对其施加的解析颗粒度。把拟合三维表面的方式改变为对概率密度空间的理解,不仅是工程上实现了一种可以无级调节的“大尺度LOD(多细节层次)”模型,同时也打破了传统资产分类部署的冷冰冰围墙。

也许在不远的未来,随着生成系统朝向更加自适应的逻辑演进,一份合格的3D数据将不再是单纯死板的顶点和法线,而会变成一种具有自知之明、能够随着设备硬件的电力波动和负载高低,自主调整解析表达张力的“活机能”。这想必才是真正通往具身智能与无缝数字孪生必不可少的一步。

【高斯算力减半新突破】VAST清华发布DeG三维生成技术

© 版权声明

相关文章