告别视觉幻觉!首个多模态并行思考框架开源:以“宽度”破局,让VLM学会分头行动

导语:面对视觉语言模型的长推理幻觉难题,首个并行思考框架以“宽度”扩展破局,实现高精度视觉感知。

当“卷深度”陷入瓶颈:为什么我们需要并行思考宽度?

这阵子,测试时扩展(Test-Time Compute Scaling)成了整个AI圈都在死磕的新方向。通过拉长模型的思考时间、增加推理步骤来提升复杂问题的解决能力,这一思路在自然语言处理领域屡试不爽。然而,当开发者试图将这套“垂直深挖”的范式直接套用到多模态视觉任务上时,却撞上了一堵无形的墙。

在视觉理解这种强依赖上下文对齐的任务中,单纯追求“推理序列越长越好”反而会带来反作用。随着生成内容的不断拉长,模型对原始图像特征的注意力会被逐渐稀释。这种现象在学界被称为“注意力漂移”(Attention Drift)。其最直接的后果,就是引发令人头疼的视觉幻觉——模型越往后想,就越容易看着图片胡说八道。既然向下垂直深挖行不通,我们能不能向外拓宽?通过展开多维度的推理“宽度”,来实现另一种形式的计算扩展?

针对这个痛点,来自浙江大学与小米MiLMPlus团队的研究人员在 ICML 2026 提交了最新的研究成果:推出了名为 Visual Para-Thinker 的全新并行思考框架。这是首个针对大规模视觉语言模型(LVLM)构建的“分治”并行思考范式,它为多模态模型如何在大尺度计算下保持视觉专注度提供了极具参考价值的解决路径。

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

分兵两路:以视觉为核心的“注意力重新分配”

并行思考听起来非常性感,但如何合理地拆分并行的执行路径?前人的研究虽然尝试过拓展宽度,但大多仅停留在文本域的多样性生成上,难以适应视觉多模态的特点。Visual Para-Thinker 的突破口在于:以视觉为中心对推理路径进行重构,其本质则是对图像 Token 注意力的重新分配。

在这套框架中,研究人员巧妙地设计了两种截然不同的视觉划分与注意力引导机制:

1. 块划分(Block Partition)

这种模式如同将任务“外包”给定位在不同区域的观测哨。它根据图像的几何区域将推理路径进行隔离解耦。具体来说,每条推理路径都会被强力绑定到某个特定的空间象限中(如左上、右上、左下、右下等子区域)。模型在思考这条路径时,必须针对性地倾注视觉注意力。

2. 扫描划分(Scan Partition)

与静态分块相比,扫描划分更强调动态轨迹的变化。在这种模式下,不同的路径承载着不同的视觉巡航视线——例如按照从左到右、从右到左、从上到下、从下到上的预设顺序去重新整合图像特征。这相当于从不同视角把图像扫描几遍,从而让不同的思维链路形成错落的侧重点。

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

在实际工程中,团队发现这两种路径各有优劣:块划分能带来极好的区域局部细节,但不同路径间可能会出现重复或冗余计算;扫描划分结构简洁清爽,但在确保各路径思维的多样性上稍显逊色。因此,开发团队采取了折中的“混合训练策略”,将两种划分下的数据融合投入训练,实现优势互补。

三大金刚法则:解决并行思考的安全与精准度

从理论设计跨越到实际运行,多路径并行会遇到几个根本性的算法难题:并行思考路径之间如何真正保持隔离?怎么保证位置偏差不会左右思考结果?怎样让模型既保持无偏又能区分每条路径生成的差异?为此,Visual Para-Thinker 从三个维度构筑了其核心控制逻辑。

隔离性(Isolation)与路径感知机制

在标准的因果自注意力机制(Causal Attention)里,后面的 Token 几乎会不可靠地将视线投向前面产生的所有内容。如果直接将多组并行思考的文字塞进同一个上下文窗口,轻则思维混乱,重则发生“信息纠缠”。

要让多模态模型真正玩转这种“分头行动”的套路,技术团队引入了路径感知注意力机制(Path-aware Attention)。通过在每条生成链上打上特殊的特殊的 <think i> 标识,在模型底部强行限制其 Attention 跨区传播,成功实现了这几条并行路径在同一层面的绝对物理隔离。

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

无偏性(Unbiasedness)破解中途迷失

此前业界的通用解法是,把不同思维路径的位置编码(Position ID)映射到完全不同的区间(例如路径一分配到100-200,路径二分配到200-300)。但大语言模型本身的先验偏置决定了它对于不同大小的位置编码敏感度大相径庭,甚至常出现广为人知的“中途迷失”(Loss in the Middle)现象。

如果不同路径之间先天就带着极度不均衡的位置权重,那本质上它依然是一个披着并行外衣的“串行思考”。团队给出的解决途径极其优雅:让所有并行思考路径的起始 Token 享有完全一样的位置编码区间(Position ID)!

这意味在网络底层看来,这几条推理路径的地位没有高低先后之分,从而保证了无偏性。等到所有的并行思考结束后,在收网的“总结阶段”(Summarization Phase),总结 Token 的位置编码再顺滑地承接于最长的那条并行路径结束时的 Position ID 后面,继续进行综合论证得出结论。

可区分性(Distinguishability)与可学习嵌入

然而,当不同的思维路径共享同一套绝对位置编码后,模型又很容易产生另一个层面的认知混乱,即无法定位生成内容分别隶属于哪条具体的推演路径。为了防止这种混淆,团队推出了 LPRoPE(可学习并行旋转位置编码,Learnable Parallel Rotary Position Embedding)。简而言之,就是在模型进行常规旋转位置编码操作(RoPE)之前,预先为属于不同路径的 Token 加入一份该路径特有的“可学习路径标识编码”。这一巧妙的设计,让模型既保留了推理空间的无偏性,又获得了极强的源头区分度。

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

Qwen3充当最强导师:16.3万样本的特色提炼

为了让这套并行推理框架成功落地并学会如何灵活拆分分析路径,研发团队针对性地构建了一个极具硬实力的多模态任务数据集,总计包含高达 163,000 个问题-答案对。这套数据大范围取材于学术界公认的高质量评测库,包括 LVIS、LAION、PixMoCount 以及 RefCOCO 等。

为了生成高质量的思维链分流样本,团队选用旗舰级的 Qwen3-VL-235B-A22B-Instruct 作为强力教师模型。通过在 0.1 的极低温度设定下,灌入由“块分区”和“扫描秩序分区”融合而成的混合训练指令,为每一个多模态样本都精准锻造出了四条以视觉重点为导向的细分推理路径。同时,为了保证数据的健壮性和去除人为造成的逻辑硬伤,还引入了更高温度设置下的 Qwen3-VL-30B 以及具有优秀表征能力的 InternVL3.5 等强力模型进行严苛的对抗验证与清洗,最终完成了极高工艺的微调数据注入。

打爆多项评测:视觉定位与计数任务迎来显著拉升

为了打消业界的疑虑,Visual Para-Thinker 被放到了多项严苛的基准测试集里贴身肉搏,包括极度考验全局视线拉扯的视觉搜索(V* 任务)、考校大模型心智极限的视觉幻觉任务(MMVP、HallusionBench)以及目标定位(RefCOCO)。

实测表现非常亮眼:在视觉搜索 V* 评测中,基于 Visual Para-Thinker 的 3B 规模模型和 7B 规模模型,分别相较于原始基座录得了 +12.6+6.3 的爆发式性能飞跃。在极度考验防幻觉的 benchmark 评测 HallusionBench 上,该方法也为 3B 与 7B 基座注入了 +6.1+5.0 的显著准确度增益。而在目标定位这一传统强项上,相较于原版的 Qwen2.5-VL 表现,也展现出了肉眼可见的精准定位纠偏。

在随后的深入剖析环节中,团队还曝光了一则非常有趣的行业观察:不同的视觉任务,对于并行思考划分模式的适应度其实有着截然不同的“性格偏好”。

比如在像素四散的“目标计数”(CountBench)这类任务上,每个分块如果各自割裂地进行计数累加,往往会因为边缘边界的交叉重合,给全局统计输入叠加巨额误差,引发积累偏置造成的视觉幻觉。这时显式的“块划分”反而会起反作用。相比之下,能够保全全局视场、仅通过流转读取方向来实现隐式注意重新分配的“扫描划分”,在计数场景里反而展现出了极高的容错率与实测表现。

多模态的“多核并行时代”是否已来?

Visual Para-Thinker 的诞生,在一定程度上暗示了 VLM 未来的另一条演进支线:如果单线程、垂直拉长多模态推理链的收益曲线已步入递减阶段,那么让不同“线程”去认领不同视觉子区域的多核分布式思考,或许将成为下一个性能飞跃的原点。

根据研究团队披露的后续路线图,接下来这项并行研究还将迅速走向与增强学习(RL)、多轮自适应交互、跨模态智能体强化(Agentic RL)等一系列风口技术的深层融合,让模型不仅能并行看,还能在多分支思考中学会根据中间结果快速自我修正。这种从“深度”到“宽度”的多维策略跃迁,或许正是多模态视觉迈向下一代强人工智能的宝贵突破口。

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

首个VLM并行思考框架亮相!多模态大模型视觉推理突破

© 版权声明

相关文章