LeCun押注10亿美元的下代AI风口,这匹深圳黑马凭什么早已提前落子?
导语:拆解视启未来如何凭借DINO-X的物理级视觉底座,攻入LeCun押注的隐空间世界模型无人区。
图灵奖得主Yann LeCun押注的“世界模型”路线,如今正在前沿科技界掀起新的风暴。就在不少人还在为如何用AI生成一段平滑的视频绞尽脑汁时,一匹来自深圳的硬核黑马已经悄然完成了技术卡位。
这支团队就是视启未来。他们不仅是全球顶尖视觉大模型Grounding DINO与DINO-X背后的缔造者,如今更将视线投向了更具挑战性的无人区——隐空间世界模型(Latent World Models)。
这是个被公认极难啃却又至关重要的底层方向。为了这条技术路径,LeCun甚至选择淡出Meta日常管理、创办AMI Labs,并拿下了惊人的10.3亿美元融资,刷新了欧洲科技史上的种子轮纪录。视启未来创始人张磊在行业论坛上的一番话十分坦率:“做世界模型很难,做隐空间世界模型更难,但我们会知难而进。”
为什么像素维度的预测,不是通往真正智能的解?
当人工智能加速从数字世界走向物理世界,原有的感知和生成逻辑正在受到挑战。智能体面对的真实世界,是一个充满不确定性、物理规律严苛且交互成本极高的实体环境。单纯让AI“看见”并堆砌像素,已经无法支撑复杂的规划与决策。
虽然近年来大语言模型在强化学习的加持下展现了强大的逻辑能力,但在物理环境中,单纯依赖在线“试错”的训练方式代价过于昂贵。真实的物理世界是不可以轻易“重置”的,每一次机器人的碰撞、摔倒,都需要付出极高的实物成本与安全代价。

真正的智能体,绝不能仅仅停留在“根据当前画面机械输出动作”的浅层阶段。只有在行动之前,学会在脑海中“想象”不同动作可能带来的结果,才能支持长时序的复杂任务决策。这正是世界模型的底层逻辑:为AI提供一个在虚拟空间里反复预演的因果引擎。
但在实现世界模型的具体路径上,行业内部形成了巨大的分歧。
很多主流世界模型依然热衷于预测下一帧“像素长什么样”。这种像素层面的生成机制,极易受到环境中微小的光影、材质和无关背景细节的干扰。AI把宝贵的计算资源消耗在了“还原落叶的每一次飘动”上,却忽略了更本质的物理实体因果律。正如LeCun直言不讳指出的那样:“在输入空间做预测是糟糕的。”

隐空间世界模型的价值,正是将繁复冗余的三维视觉像素,压缩到高度抽象的Latent表征空间中。在过滤掉漫天风沙与多变光照后,让模型直奔主题,只学习世界状态的本质演化律。
解开“黑盒”:视觉原生世界模型的三个核心支柱
虽然隐空间的优势显而易见,但目前大多数学术界与工业界的隐空间方案依然存在断层。原因在于,很多高度抽象的Latent表征彻底脱离了现实常识,模型缺乏对“物体”这一基本物理单元的感知。如果AI不知道场景里哪些是独立的杯子、桌子,不知道视角转换与主动推搡带来的变化有什么区别,只依靠黑盒式的隐空间特征,学习物理规律的转化效率依然低下。
物理定律并不是作用在像素或者抽象向量上的,而是直接作用在具体的“物体”和“空间关系”之上。
视启未来的解法,是创造性地将物体级视觉理解引入到Latent表征学习中。通过无缝融合2D感知、3D重建、语义分割与空间关系,让AI在隐空间中天然获得常识理解:“这个世界有哪些物体,它们各在什么位置,互相之间是怎样的物理制约。”这种独特的路线,被其定义为“视觉原生世界模型”。
要真正让这一模型落地于物理智能体,张磊总结了必须要跨越的三个核心维度:
- 以物体为中心(Object-Centric):表征模型必须摆脱像素泥潭,对场景中的物理实体具备结构化认知。基于对象的建模,模型才能以极高的数据效率抓取相对稳定的物理规律。
- 行动对齐(Action-Aligned):支持将人类的双手操作、各异的机械臂构型以及各种异构机器人动作数据拉通,在同一表征空间完成统一对齐,使得异质的交互数据能够被模型高效汲取。
- 因果驱动(Causality-Driven):模型不能只做静态的死记硬背,而是必须真正学会“如果实施某项交互,世界状态会如何演变”的因果关系,从而与强化学习产生深刻地正向循环。
从纯粹的像素堆叠到寻求有物理感知能力的隐空间表征,这条更难却更合理的道路,正是视启未来得以在激烈的技术长跑中确立先发优势的根本原因。
从DINO-X到EgoTwin:技术积淀转化为坚固的技术闭环
视启未来在隐空间世界模型上的笃定,植根于他们早已在全球范围经过验证的底层视觉理解神话。
这支团队孵化自粤港澳大湾区数字经济研究院(IDEA研究院)的CVR中心,在开放世界物体检测与级理解领域创造过多个行业标杆。其连续推出的DINO、Grounding DINO及DINO-X,已经成为学术界和产业界的经典模型基础设施。

在今年谷歌DeepMind发布、由何恺明与谢赛宁等顶尖学者署名的“Vision Banana”重量级论文中,DINO-X在零样本(Zero-shot)实例分割任务上的全球SOTA级表现被反复提及与认可。此外,Meta的SAM系列、阿里的Qwen系列等行业旗舰模型,在搭建视觉底座时也都深度引用了DINO的研究成果。
基于这一套行业里极其稀缺的视觉基底能力,视启未来并没有止步于理论探索,而是将技术快速转为工具抓手。他们联合百度智能云正式推出了高质量Ego人手3D对齐引擎——EgoTwin。
这是一款指向具身智能落地最痛点问题的产品:如何高效地跨越人类数据与机器人动作数据的屏障。借助EgoTwin,团队不仅实现了高达行业主流方案3.75倍的数据采集效率,更重要的是,它为视觉原生世界模型提供了大规模的“Action-Aligned(行动对齐)”优质训练数据底座,真正启动了数据与模型的演进闭环。
物理AI的“操作系统”正迎巨变
我们可以很容易地在大模型生态中找到参照物理论。在纯粹的数字世界中,大语言模型正在扮演类似操作系统的角色,底层依托算力,上层延伸出各类Agent。这一范式已在软件与Coding场景中得到极其充分的验证。
随着机器本体的加入,物理世界也在发生相同的技术嬗变。在这里,世界模型将承担起类似于物理OS的核心重任,让机器人学会自主感知、自主推演并高效习得物理技能。
视觉作为物理智能最主要、最根本的信息输入源,其在未来世界模型构建中的基石地位无可动摇。这支师承中国人工智能奠基人张钹院士,并长期在著名科学家沈向洋先生关怀指引下的精英团队,正用其沉淀多年的3D目标感知、动作捕捉与开放世界感知底蕴,踏实地构筑着下一代物理智能的底层架构。物理世界的“Next Token Prediction”,正在从蓝图逐步化为触手可及的现实。




