72.6分横扫VSI-Bench!GeoThinker开源:从被动融合到主动感知,打造空间推理新王者
导语:GeoThinker以主动感知范式重塑空间推理,在VSI-Bench斩获72.6分,全面超越开源与闭源模型,并成功赋能具身智能与自动驾驶。
视觉空间推理正迎来一场范式革命。当大多数多模态模型还在“语义强、几何弱”的泥潭中挣扎时,中山大学与引望联合团队提出的GeoThinker,以一套全新的主动几何集成框架,彻底打破了传统被动融合的僵局。该模型不仅在权威基准VSI-Bench上以72.6分斩获开源最佳,更在多项具身与自动驾驶任务中展现出惊人的实用潜力。
核心痛点:传统几何感知MLLM为何“看得见却对不准”?
当前多模态大语言模型(MLLM)在引入3D几何先验时,普遍采用“被动融合”范式,导致模型在复杂空间推理中表现不佳。其核心瓶颈可归结为四点:
- 特征对齐失准:视觉语义特征与底层几何纹理在特征维度上无法精准对齐,模型能识别物体,却难以准确判断空间位置与距离。
- 早期融合的粗暴拼接:常见的Early-stage Fusion直接在输入层进行Patch加和或拼接,忽视了不同模态间的特征分布差异,造成信息混杂。
- 无差别的全局噪声:模型不加选择地接收全局几何流,引入大量与当前任务无关的纹理(如地板、墙面),这些冗余背景掩盖了关键的空间逻辑。
- 推理阶段缺乏灵活控制:模型在推理时无法根据问题需求“按需索取”几何信息,导致处理简单任务时信息冗余,复杂任务时精度不足;而依靠蒸馏注入几何知识的方法,推理时模型依然是“被动接收者”。
GeoThinker:从“被动融合”迈向“主动感知”的架构创新
GeoThinker针对上述痛点,通过主动纹理整合实现了范式转移。其核心架构由三大模块构成,将几何信息的利用从填补式输入转变为智能查询。
1. Spatial-Grounded Fusion(空间基座融合)
这是GeoThinker的核心交互机制。它不再将几何特征生硬地加在输入层,而是通过解耦的交叉注意力机制,允许语义查询(Query)主动从几何特征(Key/Value)中检索信息。这种设计让模型可以动态锁定与任务最相关的空间结构,而非被动接受全局流。
2. Importance Gating(重要性门控)
相当于给模型装上了“空间滤镜”。该模块能预测局部注意力偏置,动态调节几何纹理的注入强度,使模型自发地关注物体边界和关键结构细节,同时屏蔽冗余的背景噪声。可视化结果显示,模型会主动增强边缘、轮廓等高价值的几何线索,并抑制平坦区域的权重。
3. Frame-wise Constraints(帧间约束)
通过严格限制在单帧内进行跨模态注意力计算,确保了语义Token与几何Token之间的精确空间对应,有效防止了视频序列中的跨帧特征干扰。这一约束在多帧输入时尤为重要,它避免了时间维度上的特征漂移,提升了时序一致性。
刷新空间智能上限:多项权威基准全线领跑
GeoThinker的“主动感知”范式在多个榜单中均展现出强大的统治力,不仅超越同类开源模型,更对闭源商业模型形成显著优势。
VSI-Bench:72.6分登顶,超越闭源与开源SOTA
在衡量空间感知的综合基准VSI-Bench上,GeoThinker-8B以72.6分拔得头筹:
- 超越闭源巨头:显著优于GPT-5 (55.0)、Gemini-3-Pro (52.5)及Gemini-2.5-Pro (53.5),证明主动几何集成带来的增益远超单纯参数堆叠。
- 力压传统方案:相较采用被动融合的VG-LLM (62.2)和无纹理编码器的Cambrian-S-7B (67.5),实现了代际式的性能跨越。
多维榜单稳固领先
- SITE (54.8/55.9):在复杂空间智能评估中保持稳健,大幅领先InternVL3 (41.1)等通用模型,证实了其在空间推理上的专精能力。
- VSI-Debiased:即便在去偏见的测试下,GeoThinker依然展现出极高的鲁棒性,表明其空间理解并非依赖语言先验,而是真正的几何认知。
- 长序列外推:仅在8/32帧数据上训练的模型,推理时直接扩展至128帧长视频,仍取得68.1的高分,展示出对时空维度极强的泛化能力。
- EASI Leaderboard:在全球综合排名中,GeoThinker以开源之姿杀入总榜TOP 6,且在VSI (72.6)和MindCube (83.0)两个单项上均列全榜第一,成为开源空间模型的标杆。
从理论到具身:赋能机器人与自动驾驶
GeoThinker的主动几何集成能力不仅停留在评测榜单,在真实下游任务中同样表现卓著。
- 具身空间指代:集成到RoboRefer框架后,在RefSpatial-Bench上平均精度提升1.66%,尤其在处理未见过的空间组合关系时,提升更高达3.89%。这验证了模型对复杂空间指令的泛化理解能力。
- 自动驾驶规划:在NAVSIM闭环仿真测试中,GeoThinker显著增强了决策安全性,将关键安全指标PDMS提升了2.0个百分点,预示着其在自动驾驶中的落地潜力。
通过可视化Importance Gating的注意力热图,可以清晰看到GeoThinker的工作机制:
- 精准锁焦:自发地(无需掩码监督)锁定物体的物理边界、边缘和关键支点。
- 智能屏蔽:对平坦的地板、单调的墙面等冗余纹理,模型会自动降低其融合权重。
- 语义驱动:这种“主动查询”完美契合人类处理物理任务时的视觉分配逻辑——只在需要感知深度或空间关系时,才调用几何直觉。
极低分辨率下的稳健性:重结构、轻像素的几何直觉
现实场景中,图像质量常因传感器限制或带宽问题而下降。GeoThinker展现出惊人的分辨率抗干扰能力:即使输入图像从100%锐减至6.25%,其Importance Gating模块依然能精准锁定目标物体的几何轮廓。这种“重结构、轻像素”的特性,源于模型通过主动查询几何纹理,在视觉信号模糊时仍能凭借对空间结构的深度理解维持推理逻辑。这使得它在长距离感知或恶劣光照等极低画质环境下具有天然的部署优势。
消融实验:从2D瓶颈到3D智能的阶梯跨越
严谨的消融实验揭示了各模块的贡献,见证了空间推理能力的阶梯式演进:
- 从2D到3D的破局(SGF):纯2D基座在空间任务上仅有28.66分,引入空间基座融合(SGF)后,分数跃升至47.45,提升高达18.7分,证明将几何信息直接注入LLM内部的主动集成远优于前端被动对齐。
- 空间精度的守护(FWC):引入帧间约束后,模型提升至48.42分。它严格限制单帧内注意力计算,消除了视频序列中的特征漂移,确保了语义与几何的精准锁定。
- 按需查询的极致(IG):加入重要性门控后,模型达到48.93的峰值性能。该模块赋予了模型“筛选”能力,自发忽略冗余背景,只为关键结构分配计算资源。
GeoThinker的成功印证了一个趋势:空间智能的未来不在于更多数据的被动堆砌,而在于模型能够根据推理需求主动、精准地整合几何结构信息。这套高效、稳健的Active Perception架构,为下一代通用多模态模型指明了方向。
本研究由中山大学智能工程学院梁小丹教授团队与引望联合完成,论文第一作者为中山大学博士生李浩源,其研究方向聚焦于3D视觉理解与空间智能。