实测阿里 Happy Oyster:一分钟的视觉奇迹背后,世界模型离颠覆游戏引擎还有多远?
导语:阿里世界模型Happy Oyster实测:它能实时生成画面并响应交互,在游戏引擎的圣殿前撬开了一道缝隙,但一分钟的视觉记忆也暴露了从“连续幻觉”到完整世界的漫长距离。
4 月 16 日,阿里正式发布了主打实时构建与交互的开放式世界模型产品 Happy Oyster。基于原生多模态架构,它支持多模态输入与音视频联合生成,并且在生成过程中能够持续接收用户指令,实现画面的实时响应与持续演绎。如果说 AGI 是终极愿景,具身智能是物质载体,那么世界模型就是这一切的认知基础——它标志着技术脉络从大模型的“预测下一个词”向“预测下一个物理状态”进行关键演进。
同一天,腾讯开源了 HY-World 2.0;次日,群核科技在港交所上市,成为“全球空间智能第一股”。更早之前,谷歌、英伟达、Meta 以及李飞飞坐镇的 World Labs 都已在这一赛道布下重兵。竞争升温之际,一个直击要害的问题浮出水面:在最宏伟的愿景实现之前,有哪些先期落地场景能够为后续争夺持续输血?在各厂商频频提及的选项当中,游戏开发无疑是最具说服力的一种。视频模型已经证明 AI 很擅长交付画面,而交互式的世界模型则再进一步,尝试为用户提供一个可以进入、修改并做出反应的场景。当模型生成的不仅是镜头,而是某种可以被操纵的世界状态,它便触及了一度属于游戏引擎的核心工作。Happy Oyster 显然也在此列。
今天的世界模型,真的足以在游戏工业中落地了吗?它会如何改造游戏开发的流程,又会被游戏工业的需求反向塑造成什么模样?带着这些疑问,我们从构建场景的基础功能入手,模拟游戏开发的真实需求,对 Happy Oyster 进行了一场深度实测。
实测一:构建场景,渲染光线——接替引擎的世界模型
Happy Oyster 的交互体验与我们熟悉的“用户说一句,模型生成一段”有着本质不同,它更像是一个松散但持续存在的概率化实时系统,用户可以在其中不断推动场景向前演化。在官方示例中,我们尝试下达了“增加角色数量”、“添加说话行为”等直白指令。令人惊讶的是,新增角色并不会突兀地凭空闪现,而是从画面边缘自然走入,这表明 Happy Oyster 并非将整个场景推倒重来,而是在已有的世界基座上做增量补充。类似地,当我们要求改变画面风格时,物品的材质呈现与环境光会随之联动调整,角色发出的声音与其原本动作之间也出现了初步的同步感。这种体验,就如同在维护一个虽然脆弱、但已真实存在的“当前状态”。
为了进一步验证,我们发出了“加入赛博朋克元素”的指令。Happy Oyster 并没有简单地叠加一层滤镜了事。霓虹灯这一赛博朋克经典符号亮起之后,画面的整体色调被重新校准,众多物品表面开始表现出更强的反射感,光影关系的同步变化彻底重塑了场景气氛。模型必须真正理解“赛博朋克”的视觉内涵,才能仅凭一句指令就在原有输出上修改出无限接近《赛博朋克 2077》质感的画面。传统游戏引擎是通过有限的资源组合加位置摆放来完成场景构建,而 Happy Oyster 显然已经跨入了隐式语义生成的阶段。
对开发者而言,变化发生在那些原本靠“搭”和“调”手工完成的环节——它们正被“描述”逐步取代。尤其是在灯光、氛围、视觉预研等前置工作当中,Happy Oyster 已经显露出生产级的潜力。创作者可以用它敏捷地尝试不同方向与画面风格,每一次试错中来回调参的成本被压到了最低。
但 Happy Oyster 的价值绝不局限于前期视觉工具。从赛博朋克这个案例可以看出,它对于绕开现有渲染流程同样具有不可小觑的意义。传统游戏引擎的渲染方案追求在有限算力下,将光照计算得尽可能逼真。整套技术栈包括:
- BRDF / BSDF 材质建模
- 光源采样(直接光照 / 间接光照)
- 阴影(Shadow Map / 光线追踪)
- 全局光照(Lightmap / SSGI / Lumen)
- 各种屏幕空间近似(SSR、SSAO 等)
尽管实现方法各异,但本质上都是在试图用可解释、可复现的计算,把画面光影推向“视觉上正确”。而世界模型的解法截然不同——它不是在把这条计算链路算得更快,而是直接去猜一个合理的结果。事实上,渲染管线本身在过去几年中也在发生类似转向。以 DLSS 3.5、Ray Reconstruction 以及近期被反复提及的 DLSS 5 为例,它们已经能够生成中间帧、替代部分去噪过程,并在最终图像层补全光照和细节。Ray Reconstruction 是用一个训练过的模型去补全有限采样下的光照信息,而一些关于 DLSS 5 的介绍也开始提到它在材质和光照观感层面对渲染画面进行进一步重建。最有趣的地方在于,最终的画面早已不是引擎算出什么就显示什么。而以 Happy Oyster 为代表的世界模型,正在更为深入地介入这个最后的环节。
如果说传统渲染是在解方程,神经渲染是在弱约束条件下做推断,那么世界模型则更进一步——在弱约束条件下直接生成。“一句‘赛博朋克风格’的指令”就是最生动的例子。三种方案都试图在有限条件下给出一个“看上去没问题”的画面,根本差别在于约束的强弱。神经渲染依然站在引擎的肩膀上,使用几何、深度、运动向量等信息,在一个边界清晰的空间里帮助开发者优化结果;而世界模型则拿出了最激进的方案:它要用最少的约束、最少的信息,直接补全到空间、光照、物体齐备且匹配的程度,生成这件事由此从像素层跃升到了世界层。
这条路不可谓不迷人,但代价同样显而易见。传统渲染的优点在于可解释、可复现——一道光为什么会这样照下来,你大体知道结果是如何计算的,出了问题很多时候可以顺着管线倒查。可一旦输出变成模型推断的结果,情况就开始变得棘手。最直接的影响就是,当输出带有概率性时,你很难进行精确约束,同一个问题不一定稳定复现,debug 成本会显著上升。在可控性问题被真正解决之前,所谓的“生成式渲染”更接近于一种强大的视觉表达工具。更现实的推论或许是:未来的游戏开发中,传统引擎将继续负责空间结构、物理规则、游戏逻辑和同步状态,而模型会逐步接管高频视觉细节、材质表现、局部补全和观感优化。Happy Oyster 这类世界模型,则将加速这一协同模式的成熟。世界仍然需要被定义,但越来越大比例的画面会被模型“猜”出来,这个比例增长的速度可能比我们想象中快得多。

实测二:“连续幻觉”,还是完整世界?
在完成场景与光照的基础测试后,我们开始尝试让 Happy Oyster 接管更为完整的游戏开发任务——制作一段玩家第一视角的游戏演示。我们给了模型一张《天国:拯救 2》的截图,要求据此生成一个完整的中世纪城镇,并用较精确的提示词控制画面氛围与视角。提示词的大意为:阴沉的天空下,一座中世纪波西米亚的防御小镇静静伫立,烟囱里飘着缕缕青烟;潮湿泥泞的道路蜿蜒而上,通往高耸城墙内一座狭窄的石门;城墙两侧耸立着瞭望塔、木屋和木制脚手架,整体色调沉稳质朴,空气寒冷潮湿,营造出真实的历史氛围;玩家以第一人称视角骑马缓缓驶向城门,沉浸于浓郁的中世纪氛围之中。
模型输出的初始画面相当惊艳。对原始截图的还原度极高,在尝试移动视角时,周围的建筑物结构也没有出现明显不合理之处,就连画面前方的 NPC 也有着相对可信的表现,代入感十足。然而,当人物转了一圈再回到原点时,初始画面里的城门已经消失了。
一致性长期是世界模型的关键瓶颈,无论从技术攻关还是落地应用的角度看都是如此。Happy Oyster 内置了导演模式和漫游模式两个版本:导演模式最长持续时长为 3 分钟,官方宣称该模式支持光照、重力、角色动作、场景因果关系保持连续一致,且允许用户实时干预;漫游模式可以做到物体位置稳定、环境持续存在、视角与光照连续响应,但最长持续时间只有 1 分钟,且只支持角色位置移动和镜头视角调整的交互。论绝对一致性时长,腾讯 HY-World 2.0 理论上甚至没有上限,但其并非生成视频,而是直接生成 3D 资产,一致性由传统 3D 渲染引擎来保障。技术路线更一致的比较对象是谷歌此前发布的 Genie 3,其官方技术文档介绍,Genie 3 已经可以达到数分钟级的视觉一致性和约 1 分钟的视觉记忆窗口——也就是说,当用户在 Genie 3 生成的世界中离开某个区域后要求返回时,之前观察到的物体布局、涂鸦、建筑结构等视觉特征仍能保持稳定的时间窗口是 1 分钟。因此,Happy Oyster 漫游模式的 1 分钟成绩,在像素级实时渲染世界模型这一细分赛道中,已经属于第一梯队水平。
但落到生产场景中,状态难以持久所导致的场景细节逐渐破碎、同一个对象反复变形等问题,意味着今天的头部水平未必足以承担起系统级的交互任务。至少在现阶段,世界模型更接近一种带有时间连续性的可交互视频系统,而非成熟的新一代游戏引擎。也正因如此,世界模型最先带来的改变不会发生在游戏形态本身,而是从改造开发流程开始。一个比较现实的演进顺序是:世界模型首先会被用于快速生成世界设定,替代一部分概念原型工作;接着作为低成本试错工具,供给镜头、环境氛围、游戏节奏这类原本需要通过引擎反复微调的内容生产;再往后,才会延伸到内容辅助生成。Photoshop 没取代相机,Houdini 也没取代引擎,但它们都实实在在地改变了很多人的工作流。对于传统游戏引擎而言,世界模型或许也是一样。

世界模型初体验:一分钟的奇迹,与更远的未来
游戏从来不是连续的画面那么简单。开发者真正的心血,大量花在关卡节奏、数值反馈、机制组合、玩家路径控制这些结构设计上。这些任务兼具强约束和高可预测性,而这正是今天的世界模型最为薄弱的地方。此外,一款能够商业化并长期留住玩家的游戏,往往意味着数十小时的内容量、稳定的系统循环,甚至是多人同步的大型世界。至少就当下而言,世界模型还远远没有走到这一步,这也是为什么它们更像是一次性体验的生成器,而没有展现出更成熟的产品形态。
但对迈向游戏行业的世界模型而言,真正重要的问题从来不是能不能干掉传统引擎,而是如何塑造一种全新的游戏体验。过去更常见的路径是玩家下载游戏,进入一个预先设计好的世界,按照开发者设定的规则行事。而世界模型带来的另一种可能是,玩家可以依据自己的兴趣自由描述,然后直接进入由系统即时生成的世界中。当这个入口成立,世界模型对游戏行业的颠覆就不再局限于开发管线,而会是整个内容生产范式的转变。如果“世界生成”变成一种廉价的能力,“玩家为什么愿意留下”就会成为更昂贵的洞察,游戏工业将重新向着游戏体验设计的本质回溯。
今天的 Happy Oyster 只能维持一分钟的视觉记忆,但这短暂的一分钟,已是弥足珍贵的第一分钟。它让我们看到了生成式世界模型从论文走进产品的真实样貌,也标记出了那条从“连续幻觉”通往“完整世界”的漫漫长路上,最先被点亮的一段坐标。