多智能体视觉幻觉滚雪球?ViF轻量方案:视觉流直接传递,幻觉降低近40%!
导语:多智能体视觉协作中,幻觉雪球效应如何破解?ViF用视觉流直接传递,幻觉降低近40%!
智能体协同处理复杂视觉任务时,一个致命问题正被越来越多研究者关注:随着交互轮次增加,视觉错误像滚雪球般不断放大,最终导致系统崩溃。这项发表于ICLR 2026的研究发现,根源不在于模型能力不足,而是智能体之间传递视觉信息的方式存在根本性缺陷。
来自新加坡国立大学LV-Lab等机构的研究团队提出了ViF(Visual Flow)——一种即插即用的轻量范式,通过视觉流替代传统文本流,结合注意力重分配机制,无需改造基座模型即可大幅压制幻觉雪球效应。在8大基准、4种MAS结构、10款主流VLM上,ViF实现了稳定提升,其中幻觉滚雪球分数平均下降超30%,交互密集场景降幅近40%。
纯文本流:视觉幻觉滚雪球的根源
当前多智能体视觉协作普遍依赖文本流传递视觉信息,这一设计存在两大无法规避的缺陷:
- 内在幻觉:单智能体生成与图像不符的错误视觉描述;
- 幻觉传播:后续智能体过度依赖前置文本,将早期错误当作先验,视觉-文本转换的损耗与偏差被逐级放大。

此前优化方案几乎都聚焦于单智能体幻觉抑制,无法阻断跨智能体的错误传播。长轮次协作中,模型性能被幻觉雪球拖垮,难以胜任复杂视觉任务。
三维注意力分析:锁定关键成因
研究团队从轮次、层级、令牌三个维度进行深度注意力拆解,首次系统性地揭示了幻觉雪球的本质:
- 轮次维度:随着轮次增加,后续智能体对前置文本的注意力权重异常升高,视觉注意力逐渐淡化;
- 层级维度:中层VLM层更关注视觉信号,深层层则偏向语言,但文本流导致视觉信号在深层被严重稀释;
- 令牌维度:关键视觉令牌在深层注意力分数被压抑,而文本令牌过度主导,幻觉由此放大。

这些发现为精准修复视觉信息流提供了关键依据。
ViF:视觉流替代文本流
ViF彻底抛弃纯文本传视觉的逻辑,打造即插即用、模型无关的轻量视觉直接传递范式,两大核心设计直击痛点:
视觉中继流(Visual Relay Tokens)
精准筛选中层单峰视觉令牌作为中继载体,结合指令做轻量化上下文编码,直接传递原生视觉证据,从根源避免“视觉→文本”转换带来的信息损耗与偏差。
分层注意力重分配
- 中间层:放大关键视觉令牌注意力,回收无效注意力;
- 深层:优化注意力分布,让视觉信号持续贯穿长轮次协作。
针对现代模型常用的FlashAttention 2/3(无法获取注意力分数),ViF设计了Key-Norm替代策略,兼顾效率与落地兼容性。该方法开销较小,可无缝适配不同VLM与MAS结构。
全维度提升:幻觉雪球降近40%
ViF经过全面实验验证,关键结果如下:
- 全覆盖稳定提升:在8大综合/幻觉基准、4种MAS结构(线性/分层/随机/环形)、10款基座模型(LLaVA、LLaVA-OV、Qwen2-VL、Qwen2.5-VL等)上,平均提升2.4%~3.8%;
- 视觉幻觉雪球抑制:提出幻觉雪球分数HS,平均下降超30%,交互最密集的环形结构降幅近40%;
- 大模型增益更多:34B/32B参数模型提升超4%,彻底解锁大模型多智能体潜力;
- 多场景通吃:多图、视频等增强视觉场景,平均提升2.0%~4.9%;
- 高效:仅增加8.1%~13.4%推理延迟、4.8%~11.9%计算开销,大模型下开销几乎可忽略。
对比5款SOTA单智能体幻觉方案,ViF在多智能体场景下实现断层式领先:传统方案只从单智能体出发,ViF从底层切断视觉幻觉传播,显著抑制多智能体幻觉雪球。
展望:解锁有效长轮次视觉多智能体协作
ViF是首个从信息流重构层面解决多智能体视觉幻觉雪球的方案,直接打破长轮次协作“越做越错”的魔咒。它以较小代价建立智能体间的视觉流信息传递,让多智能体协作真正可信、可用。