性价比飙升9倍!海螺AI视频大模型新版发布,物理世界“穿模率”大幅度降低
导语:详解MiniMax最新视频模型Hailuo 02:物理感知力大增、价格骤降背后的技术奥秘。
多模态视频生成大模型的研发,从来都是一项极其复杂的系统级工程。这不仅仅关乎画面是否足够精细,更是一场涉及跨模态对齐、时序一致性控制、精细化动作编辑,以及底层算力成本优化等多重维度的极限拉锯战。正因为门槛极高,这个赛道长久以来被视为国际科技巨头与国内互联网大厂的专属游戏。但在群雄逐鹿的格局下,本土创新力量也正在用极具差异化的路径打破垄断。MiniMax 刚刚发布的迭代产品 Hailuo 02,就在视频生成领域投下了一颗技术震撼弹。
在第三方权威评测平台 Artificial Analysis 的最新视频模型榜单上,Hailuo 02 一经亮相便斩获高分,其 ELO 评分一举超越了谷歌最新推出的 Veo 3 以及快手旗下的 Kling 2.0,直接跃升至全球视频模型排行榜的第二名,打破了巨头的霸榜常态。
动作与力的相互牵引:如何让AI告别“违背牛顿”?
在许多评测者与专业导演的反馈中,“电影级镜头张力”和“逼真的物理交互”是 Hailuo 02 最为显著的标签。影视工业级镜头往往伴随着高速、复杂的摄像机运动与多物体的剧烈动作交互。对于生成式 AI 而言,维持长距离镜头中的物理规律一致性极为困难,模型极易出现细节丢失、肢体穿模甚至物理法则瞬间崩塌的现象。
在一个看似简单的“马匹跃起并落地奔跑”测试指令中,模型需要精准处理人、马、地面以及障碍物之间的力学联动。这考验的绝非刻板的姿态对齐,而是力的流动所产生的复杂质感。在实际生成中可以看到,Hailuo 02 较好地处理了马匹起跳、腾空到落地过程中的惯性转移,马鬃毛的飞扬方向、骑手身体的重心起伏都符合现实物理特性。而在部分同级别模型的横向对比中,却出现了起跳点错位、人马重心分离等情况,人甚至在马匹起跳时呈现出怪异的悬空漂移感。
在另一个被视作“模型杀手”的趣味测试提示词“Hello Kitty 击打网球”中,网球与球拍在触碰瞬间的轨迹重塑同样检验着模型的物理理解。Hailuo 02 还原了球拍挥动、击球偏转的连贯过程。而对照组的测试模型则频繁翻车,有的模型让网球绕着球拍产生了具有魔幻色彩的螺旋运动,有的则出现了球体在接触网球拍瞬间丢失,球拍犹如磁铁般凭空吸附球体的奇特场景。
跨帧一致性突破:应对滑雪与杂耍的多维时空挑战
长镜头与快速运动带来的另一个棘手难题,是背景的大幅移位与细节渲染。以极限滑雪场景为例,当镜头随着滑雪者高速平移时,背景中的雪山会产生快速的视差变化,雪板在雪地上快速滑行时应当掀起具有方向性的雪浪,并留下一条深浅不一的行进轨迹。在海螺生成的视频中,雪花飞溅的角度、体量与雪板划过的阻力方向形成了呼应,滑雪板的物理抓地感得到了保留。相比之下,其他模型的雪道质感偏向静态,雪板甚至在高速回转时与滑雪者的双脚发生了剥离,产生了严重的贴图穿模问题。
视频的帧率与时间每增加一秒,其时序控制的运算量就会呈几何级数上升。这也是为什么市面上多数模型为了求稳,往往将画面的基础生成时间限制在 5 秒以内。而一旦画面中出现多个需要动态交互的小道具,模型的表现就会呈断崖式下滑。
例如,在“双手快速抛接六个杂耍球”这一高难度多体交互场景中,海螺展现了极强的跨帧连贯性。六个球体在空中的抛抛落落并没有导致形状的变形与闪烁,观者可以清晰追踪每一颗球的升降轨迹,且球体数量自始至终保持稳定。而在对标大模型的测试用例中,“吞球”现象屡见不鲜:球体抛至空中时会突兀地融合成一枚,或者在落下的过程中凭空蒸发,这本质上是模型对于空间物体连续追踪计算出现逻辑混乱的表现。
深挖“导演意图”:从浅层字面到深层影像直觉
生成好画面的前置条件是“读懂”画面。对于图生视频来说,理解首帧图像隐藏的深层信息是能否产生优质运镜的关键。当第一帧出现马匹面对栏杆的静止画面时,人类导演的专业直觉是“马需要跨越它”,而 Hailuo 02 准确地捕捉到了图中的潜藏意图。在分析“运动幅度:中等”等模糊指令时,不同的算法各显神通:有的模型为了避免失真,仅仅摇晃镜头,角色本体却宛如木雕;有的仅仅动了动面部表情。海螺的表现则更符合直觉,能将“中等幅度运动”映射到颈部、双臂及主关节的自然协同运作上。
在“动画风格,骑车女主角穿行于小镇狭窄街道,稳定侧面视角”的测试中,海螺做到了主体人物与背景建筑位移的合理反差,甚至在侧方特写镜头中,成功渲染出了动漫人物在春风拂面下的积极情绪变化。然而,在其他一些大模型的生成画面里,运动的方向判定出现了南辕北辙的系统性逻辑错误,导致主角在骑行时发生了倒滑,整个运镜节奏显得违背逻辑。
底层NCR架构的重构:性能翻倍与价格壁垒
海螺技术升级的核心支撑,来自 MiniMax 团队对底层模型架构进行的彻底重构。Hailuo 02 抛弃了传统的逐帧运算体系,引入了全新的 Noise-aware Compute Redistribution(NCR,噪声感知计算重分配)机制。
NCR 机制能够基于噪声水平主动且有计划地对长视频 Token 进行定向压缩,借此建立分级式去噪目标。搭配特制的噪声调度算法,最终使同一个大模型能够进行超高效率的联合训练。这套底层架构极大地优化了算力的利用效率,使得海螺在同等参数配置下的训练和推理效率暴增了 2.5 倍。
有了 2.5 倍效率红利的托底,MiniMax 得以在开发中放飞自我,将 Hailuo 02 的参数规模直接推高了 3 倍之多,用于训练的数据集体量更是扩大了 4 倍。高参数和丰富数据的供给,为后续的推理性能优化预留了巨大的冗余深度,直接拉高了模型的指令遵循能力。据官方测算,Hailuo 02 的复杂指令遵循率高攀到了 85%,在处理繁复细致的输入指令时,相比同行能够更敏锐地抓住文字的核心主旨。
更为关键的是,效率重构带来的直接成效体现在使用门槛的骤降上:
- 在保证相同画面输出质量的前提下,海螺支持更长、更低成本的高清内容输出。
- 特别在 1080P 高清分辨率视频的商业输出中,其性价比表现优异。
- 相比同期发布的谷歌 Veo 3,Hailuo 02 的调用成本低至后者的接近 1/9,将高端视频生成的门槛拉平到了亲民的水平。
这或许代表了国内 AI 厂商在商业道路上截然不同的一种审美逻辑:比起单纯在象牙塔内以极限算力攻坚实验室跑分,海螺更倾向于从极低的商业门槛出发,让高水准的 AI 视频创作工具飞入寻常创作者的电脑中。顺着这一路线,海螺表示接下来还将重点针对偏好对齐、多画面抽卡稳定性,以及高阶文本生视频(T2V)、图生视频(I2V)之外的复杂控制功能进行深度演进,把电影级别的虚拟拍摄体验变得更加触手可及。
