把十亿粒子世界装进网页:国产开源3D引擎凭什么正面挑落李飞飞?
导语:把十亿级粒子的三维场景装进网页?看国产开源引擎如何用底层路线叫板李飞飞。
互联网诞生几十年,我们对媒介的交互体验其实一直笼罩在“妥协”的阴影下。
真实物理世界本是三维且连续的,但受困于过去有限的网络带宽、参差不齐的硬件配置以及二维媒介的传播习惯,信息媒介被残酷地降维。文字、平面大图、扁平的视频,构成了这几十年数字生活的一切。这种妥协虽然降低了分发门槛,但也将人与场景的交互死死封存在了屏幕的玻璃幕墙之后。
虽然 3D 高斯泼溅(3DGS)的问世让“利用普通视频/照片瞬间重构真实世界、并享受无死角实时漫游”成为可能,但这套看似惊艳的技术在商用最后一百米上却踢到了铁板:怎样才能免去笨重的本地渲染环境,使任意普通用户在零插件的浏览器里瞬时、流畅地探索这扇三维大门?

今年 4 月,由人工智能学者李飞飞领衔的空间智能独角兽企业 World Labs 开源了其 3D 高斯渲染引擎 Spark 2.0,试图以一种全新架构打破网页漫游的性能屏障。不过,这个赛道的竞逐远比想象中猛烈。日前,空间智能平台 Aholo 工作组正式开源了其 3D 渲染引擎 Aholo Viewer,并将代码全部推上了 GitHub。
令人惊讶的是,在核心的页面加载效率与大场景极限承载度上,这款国产引擎多项测试指标直接超越了 Spark 2.0,拉着浏览器在十亿级高斯粒子渲染的极限边界上狂奔。
突破硬件瓶颈:给三维网页渲染全面“瘦身”
为了让普通大众不再需要配备专业级独立显卡即可丝滑体验三维互动,渲染底层必须彻底解决“数据胖、读取慢、开销重”的死穴。要知道,传统 3D 渲染动辄需要下载数个 GB 的文件,并且由于 3DGS 将整个真实空间表征为由数千万至数亿个带有颜色、位置、透明度的 3D 高斯椭球体组成,这也让 GPU 进行实时排序和光栅化的计算压力成倍飙升。
针对这一行业共性痛点,Aholo Viewer 通过将优化深入到显存和渲染管线的底层细节中,实现了一次全方位的突围。

在面向一个包含 3 亿高斯点的复杂户型及商圈扫描场景的真机评测中,Aholo Viewer 在桌面浏览器端吃下的内存开销仅仅是 Spark 2.0 的一半左右。同样令人吃惊的是速度指标的飞跃:其首屏大图的静态加载速度比后者缩短了将近一倍,而代表运动流畅度的每帧渲染耗时更是缩减为 Spark 2.0 的三分之一。
更具颠覆性的是系统极限值的突破:Spark 2.0 的场景解析上限大约在 1 亿粒子,一旦面对更宏大复杂的物理空间,网页就免不了遭遇内存溢出导致的崩溃;而 Aholo Viewer 将承载极限一举推到了惊人的 10 亿高斯点。这在移动端设备或普通的轻薄办公本上,意味着用户终于可以用“点开即看”的形式秒级步入一个街区甚至整座博物馆的动态空间。
细节层级架构之争:为什么说分块 LOD 赢了?
要理清 Aholo Viewer 之所以能吃掉 Spark 2.0 数倍性能优势的原因,必须要探寻两者截然相反的细节层次模型(LOD)构建逻辑。
李飞飞团队的 Spark 2.0 实质上采用了 Splat-based LOD Tree(基于单个高斯粒子的 LOD 细节树)。其方案从微观的小椭球体着手,自下而上做粒子的合并与归置,试图借此在距离变化时实现不易察觉的细节过渡。
然而,在真实浏览环境里,由于粒子合并缺乏明确的物理及空间块状边界,内存与显存的管理会变得混乱无序,GPU 在每一帧都要计算和决策成千上万个离散粒子的调用次序。当视角快速移动时,这种底层逻辑极其容易引发计算管线拥堵,使得画面经常出现无法抹去的细微卡顿,同时也让内存缓存的有效命中率大打折扣。
与此相对,Aholo Viewer 避开了逐粒子合并的泥潭,选择以 Chunk-based LOD Tree(基于分块的 LOD 细节树) 作为研发底盘。

这套机制不再把精力纠结于单个粒子碎片的开合,而是预先将庞大的 3D 场景按空间区域划分出若干明确的数据区块(Chunk),并单独为这些区块建立各个解析纯度下的 LOD 模型。在网页实时交互阶段,系统是以 Chunk 为整体单元进行局部层级切换和读取决断的。这一逻辑转向,带来的是工程表现的全面优化:
- 显存占用极度轻盈:粗颗粒的数据块管理模式,使得内存调度的底层计算负荷极其低廉。由于缓存命中效率极佳,Aholo Viewer 在切换细节时几乎不产生额外的计算开销。
- 超大规模场景无感叠加:因为有了精确且互相独立的 Chunk 块模型,在未来想要扩展至数百亿级别、甚至整个城市街道量级的空间测绘和动态加载时,技术人员只需要按照物理方位拼接并异步刷进数据即可,扩展性完全改善了基于散落粒子合并的旧路线。
在图形管线的最底层,Aholo 技术团队还融入了 Morton 编码来整合一维存储空间下的粒子寻址排序,再通过按需 GPU 通道压缩技术和精度可裁剪结构,为显像核心省下了极大的运算流水线时钟周期。

脱离炫技:从单纯的“可看”走向工程落地
任何一种图形渲染底层要想在互联网引发波澜,仅仅让用户“能看”是不够的,核心指标是能不能轻松嵌入当下成型的产业生产链中。
在这一点上,群核科技的 Aholo 与 World Labs 的底层商业主攻方向也显露出极大不同。World Labs 更渴望借由生成式 AI 去凭空构造新维度的概念空间;而深耕工业设计、空间测绘多年的群核科技则更加侧重真实物理世界的数字化复制与资产重塑。
因此,除了开源前端极速浏览器 Aholo Viewer,Aholo 平台本身进一步释放出了整套三维智能应用 API 工具箱:
- 云端异构渲染:在无需任何本地高端光追显卡前提下,支持 3DGS 技术与工业界普遍使用的 Mesh(三角形网格模型)深度混编渲染,以视频流方式实时向平板、手机分发。
- 全自动三维物理克隆:用户仅凭一款常规智能手机拍录的环绕视频,其云端接口就能够在几分钟内输出比例为 1:1 的数字孪生模型。
- 高质量学术级数据集:开放专供具身智能自主训练的语义数据集(如知名度角逐激烈的 InteriorGS),使虚拟环境里的机械手臂或小车能够用最逼真的三维形态展开交互模拟演练。
这带来的不仅是数据解析格式的多方兼容,更是应用场景的无限下放。比如文旅数字化领域中,一件精细编排的历史文物能够被极速重建并放到微机页面,网民动静结合地交互把玩;在愈加短平快的交互短剧制作链路,导演也可以快速拍几张静态照来构建三维虚拟演播片区,通过 API 实时编辑并重布环境光源,免去了过去动辄数十万搭建实体棚甚至传统 3D CG 渲染的漫长成本线。
三维数据,终将成为 AGI 世界模型的最短捷径
表面上看,3DGS 渲染器的技术推进只是让一两个网页的加载帧率变得好看。但在整个通用人工智能商业进程的沙盘中,这颗棋子的位置甚至关涉到谁能最快训练出更强大的“物理世界模型”。
目前,行业顶尖的大语言模型和多模态 AI 已经快要吃光全网堆积了几十年的文本及平面素材资源,然而这并不能让 AI 获得像人类一样对于外部物体力学特征和立体维度的真实认知。要想让 AI 正确理解距离、遮挡、引力、以及多移动实体的真实关系,就必须给它投喂足够逼真的 3D 传感器和空间结构数据。
长久以来,三维建模数据由于极高的制作成本和难分发的痛点,其在网上的体量仅为视频和图画的九牛一毛。
而以 Aholo Viewer 这类开源工作为载体,网页彻底变成了极速且低门槛的数据分发管道。一旦人人都能在网页和 App 间自如生产、分享和漫游 3D 全景图像,“海量物理世界重建数据 -> 算法高仿真训练 -> 更多高级智能体上线 -> 生成更庞大 3D 信息流”的数据飞轮将能够全速运转。
正如现实世界的物理边界无可违逆,互联网的内容媒介形态,也终将在空间智能的驱动下朝着更契合人脑认知的 3D 多维维度实现真正的觉醒。