干掉冗长串行,小红书开源HyperEyes让多目标搜索效率飙升5倍

导语:小红书推出HyperEyes并行多模态搜索智能体,打破串行延迟瓶颈,实现检索效率与准确率的双重飞跃。

如果给当下的多模态搜索智能体(MMS Agent)来一次体检,诊断书上大概率会写着:慢性消化不良。面对一张包含多个商品、地标或人物的复杂图片,主流模型往往只能像打字机一样,机械地开始「裁剪图片-发起搜索-解析结果」的套娃式循环。这种串行机制不仅把交互时间拉得无比漫长,还极易在某一步走偏后引发多米诺骨牌效应,导致整个任务彻底崩溃。

针对这个长久以来的效率死结,研究团队交出了他们的答卷。小红书联合学术界开源了全新多模态检索模型 HyperEyes,提供了一种从「搜得更深」到「搜得更宽」的并行设计路径,彻底打破了传统智能体在多目标搜索场景下的效率瓶颈。

目前,该项目的论文与代码均已向社区开放:

  • 论文地址:https://arxiv.org/abs/2605.07177
  • 项目代码:https://github.com/DeepExperience/HyperEyes

串行调用之下,大模型搜索的「三大死穴」

要看懂 HyperEyes 的突破,先要搞清楚传统 MMS Agent 到底被什么绊住了脚。当用户给出一张多人物合照并提问「图里的这几个人都是谁,他们合演过什么电影」时,常规的 AI 处理路径是极其笨拙的:

首先是交互冗余引发的延迟灾难。智能体会先裁剪出第一个人,去搜索引擎查出名字;再裁剪第二个人,重复上述操作……单次查询被粗暴地强行拆解成 N 轮独立的单目标搜索,每一次工具调用与数据往返,都让用户在屏幕前多焦灼一分。

其次是容错率极低的「错误级联」。在串行流程中,一旦前置定位框出错,或者搜索引擎返回了第一张图的干扰噪声,后续所有步骤里的逻辑判断都将被严重污染,智能体会在错误的道路上越走越远。

最后是传统强化学习在对齐阶段的「信用分配」偏差问题。业界常采用「唯结果论」的稀疏奖励机制,即通过最后的答案对错来给模型打分。这带来了极为恶劣的双重反馈:一方面,模型为了追求准确率,会肆无忌惮地采取「暴力多搜」的策略,制造大量无用交互;另一方面,一旦任务在最后关头遗憾失败,系统会直接否定中间所有原本正确、极具逻辑性的工具调用和推理,对中间步骤实行无差别抹杀,这导致模型很难从失败轨迹中提炼出局部正确的行为范式。

动作空间与数据的全栈重构

为了让智能体真正学会「一次出手,同时捕捉多个目标」,HyperEyes 团队在架构、语料和强化学习三个层面实施了底层改造。

在架构设计上,团队将此前隔离的「视觉定位」与「网络检索」融为一体,推出了统一定位即搜索(UGS)的动作空间。UGS 直接将视觉定位框嵌入到检索工具的动作参数内。也就是说,现在模型发出一次检索请求,就可以并发携带多个待查询区域的坐标信息,从硬件调度的物理层面,率先铺平了多目标并发的道路。

要跑通并行流程,还需要匹配的训练数据。开源社区此前对这类并行指令微调包几乎是空白的。为此,研究团队设计了一套复杂的数据合成流水线:利用图谱随机游走,拼接多类图像以构造存在交集约束、无「捷径特权」的多实体问题;再配合渐进式拒绝采样(PRS)机制,在极为有限的多步资源约束下挑选高质样本,最终淬炼出包含 3 万条高纯度并行交互记录的行为种子数据,打破了 SFT 训练的冷启动困境。

双粒度强化学习:给大模型穿上效率「紧箍咒」

既然传统的强化学习(RL)考核方式难逃偏颇,HyperEyes 便换了一套打法:引入「宏观 + 微观」的双粒度效率感知强化学习框架。

【HyperEyes多目标搜索提速5倍】多模态搜索智能体

在宏观层面,任务轨迹引入了名为 TRACE(动态参考的成本效率奖励)机制。它并不是强硬规定模型只能用多少步,而是成为一把会自我进化的浮动标尺。只要智能体当下的尝试比此前最高效的路径更加干净利落,就能得到额外嘉奖。每次迭代后,表现最好、耗时最短的成功路径就成了新的最低要求,逼迫模型不断在效率极限上试探。

而在微观 Token 层面,为了解救那些「功亏一篑」轨迹中的明珠,团队祭出了 OPD(策略内蒸馏)机制。这是一个非对称机制,非对称意指它只在任务失败时才会触发。此时,后台会召唤出一个 235B 容量的满血版教师模型,针对整个挫败轨迹进行全量扫描,找出中间每一步原本正确的推理动作,直接给予 Token 级的稠密精准奖励。如此一来,即便最后结果没拿分,中间闪光的逻辑断点也被成功保留,绝不打击模型对于「并行提效」的底层直觉。

用 IMEB 基准打破「唯高分论」

目前通行的各种多模态跑分榜单,或多或少都有些偏袒靠堆砌算力、死缠烂打拿到正确答案的模型。为改变这一局面,研究团队在发布 HyperEyes 的同时,还顺带抛出了一个全场景图片多目标行为评测集 IMEB (Image Multi-Entity Benchmark),提供 300 道硬核多体提问。

与之配套的则是 CAS(成本感知评分)。它打破了传统的评价盲区,将准确度、搜索轮数及 Token 折算消耗塞入统方程序,考核的是「单位延迟下产出的信息流质密度」。这也代表着,如果算法为了最终的准确而进行无度的拖沓搜索,就会在这个机制下拿到极低的惩罚分。

通过 6 大主流测试集检验,HyperEyes 表现优异。在 30B 参数级上,HyperEyes 相比同门顶尖好手 VDR 提升了 9.9% 的准确度。而反映效率的性能开销更是对比鲜明:完成同等难度的任务,其平均工具占用次数从 VDR 的 11.6 次断崖式缩减至 2.2 次。来到更高级别的 235B 版本上,HyperEyes 与闭源王者 Gemini-3.1-Pro 的比量已相差无几。

在反映极限功耗比的 CAS 成本评分中,HyperEyes-30B 更是达到同类模型均值的 7.6 倍之多,表现出极强的资源支配性价比。同时,少搜、并联的底层特色还自带防过拟合Buff。由于没有让智能体在海量噪声数据里来回倒腾,它在干扰环境下反而呈现出更加干净的执行路径,免除了解检索中常见的幻觉毛病。

在一个 6 人同镜合影的信息探查实例里,其他智能体被逼出 12 轮艰难裁剪寻路,最终在一堆噪音中迷失崩溃;而 HyperEyes 仅开出 3 轮检索便将全局信息梳理分明。高并发、少出手的优势在实操中体现得淋漓尽致。

长期以来,很多人默认搜索智能体的准确性只能靠不断迭代推理深度来换取。HyperEyes 的落地成功证伪了这一路径依赖:通过合理的动作空间规划与非对称的对齐优化,效率与精准是可以协同进化、兼得其妙的。对于未来面向业务层的高并发 MMS 场景,这无疑提供了一条极具参考价值的效率升维之路。

【HyperEyes多目标搜索提速5倍】多模态搜索智能体

© 版权声明

相关文章