全模态AI智能体新基准OmniGAIA:360道地狱级任务,测出开源模型真实水平仅13分!
导语:现有多模态大模型缺乏全模态统筹与工具调用能力,OmniGAIA基准和OmniAtlas训练秘籍为迈向通用AI助理铺路。
引言:人类的智能交织与AI的短板
人类的智能天然是多模态融合的——我们同时用视觉、听觉、语言进行交流,还能进行复杂推理,并灵活使用外部工具。然而,当前主流的多模态大模型大多局限于图文或音文双模态,缺乏作为通用AI助手所需的全模态统筹、长程推理与工具调用能力。为此,中国人民大学、小红书、东南大学、浙江大学和清华大学联合推出了OmniGAIA基准和OmniAtlas智能体训练框架,旨在系统评估并提升原生全模态AI智能体的能力。
痛点:为什么现有评测不够看?
随着Qwen3-Omni、Gemini-3等全模态大模型的出现,模型已能统一处理文本、视觉和音频。但现有评测基准(如OmniBench、WorldSense)大多基于极短的音视频片段,题型多为选择题,侧重感知而非推理。真实世界中,AI需要解决的问题要复杂得多。例如:
“视频里导游指着远处的一座活动桥,解说提到这让他想起了电影《福禄双霸天》。请问这座桥到底叫什么名字?在1979年电影开拍时,这座桥已经建成了多少年?”

这要求AI不仅能理解长视频中的视觉和音频信息,还能主动搜索外部知识、进行跨模态推理和计算。现有基准无法衡量这种能力,OmniGAIA应运而生。
OmniGAIA:全模态智能体新基准
OmniGAIA包含360个源自真实世界的高难度任务,覆盖地理、历史、科技等9大领域。输入形式包括数十分钟的“视频+音频”以及复杂的“图片+音频”组合。模型不能靠盲猜,必须多次调用外部工具(如搜索引擎、浏览器、代码解释器)才能得出唯一可验证的开放式答案。
构建方法:首创“全模态事件图谱”驱动法
为了自动合成逻辑严密且防作弊的高难度问答,团队设计了一套精妙的流水线:
- 数据收集:从FineVideo、LongVideoBench、COCO 2017等来源筛选整理视频(含音频)及“图像+音频”数据,覆盖100多个垂直领域。
- 高价值信息挖掘:使用Gemini-3-Flash提取事件、环境分析、音频分析(ASR、说话人识别)以及图像理解(OCR、物体识别等)。
- 全模态事件图谱构建:DeepSeek-V3.2通过规划后续步骤、利用工具获取新信息,并结合LLM自我反思与人工审查来迭代扩展初始事件图谱,确保事实准确性。
- 问答生成与审查:通过事件模糊化生成高难度多跳问答对,再由LLM和人工共同验证准确性、难度和答案唯一性。
OmniAtlas:打造原生全模态智能体的训练秘籍
面对开源模型在基准上的惨淡表现,团队同步推出了OmniAtlas——一套完整的训练方案,遵循工具集成推理范式,包含三大核心组件:
1. 主动全模态感知
传统全局降采样会丢失细节。OmniAtlas赋予模型“按需感知”能力,通过内置工具(read_video/read_audio/read_image)精准截取特定时间段或裁剪特定区域,实现高保真感知。
2. 高质量轨迹合成与监督微调
利用强大推理模型进行“后见之明引导的树搜索”,在已知正确答案下剪枝错误分支,合成完美的“思考+工具调用”成功轨迹。在监督微调阶段,采用掩码监督(Masked SFT),仅对模型生成的“思考和动作”计算损失,屏蔽外部工具返回的冗长噪音,让模型学会真正的思考。
3. OmniDPO细粒度纠错
全模态任务极易一步错步步错。团队首创OmniDPO,能精准定位失败轨迹中的第一处错误点(是没看清、听漏了,还是搜索关键词错了?),并生成纠正后的正确前缀,构建正负样本对进行偏好优化,实现对症下药。
实验结果:巨大性能鸿沟与深层归因
主结果:闭源王者与开源模型的差距
在统一提供外部工具的环境下,评测结果触目惊心:
- 闭源领先者:Gemini-3-Pro一次通过率高达62.5%,展现出成熟的规划与验证能力。
- 最强开源模型:Qwen-3-Omni (30B) 仅有13.3%,差距近4.7倍。
- 参数规模并非万能:拥有5600亿参数的LongCat-Flash-Omni得分竟不如30B模型,证明智能体工具调用策略比单纯参数规模更重要。
- OmniAtlas显著提升:经OmniAtlas训练后,Qwen-3-Omni准确率从13.3%提升至20.8% (+7.5);在7B模型上,更是从3.6%提升至13.3%,提升近4倍。
错误分析:AI到底错在哪一步?
对失败轨迹的剖析显示,开源模型在困难任务中超过90%的失败源于工具使用不当——要么未调用工具,要么陷入搜索死循环、查错方向,直接导致下游任务崩溃。
工具调用行为:越多越好吗?
散点分布图揭示了有趣现象:“工具冷漠症”(0次调用)模型成功率极低,证明仅靠先验知识无法应对复杂场景。但并非调用越多越好——部分失败轨迹调用10-20次以上,却都在做低效重复,无法有效降低不确定性。OmniAtlas使工具调用更加主动,有效探索率提升拉动了过关率,但也带来了一定冗余,未来需平衡性能与效率。
原生全模态感知 vs. 外挂感知工具
消融实验回答了一个关键问题:我们真的需要原生全模态模型吗?能否用纯文本模型外挂识图/听音API?
- 对于强模型:原生是王道。 Gemini-3-Flash原生感知得分51.7,工具调用仅4.4次;改成外挂后成绩下降,API调用成本翻倍至9.4次。
- 外挂工具打不了硬仗: 对于较弱开源模型,外挂感知在简单题上略有提分,但在需要跨模态推理的难题中成绩直接崩盘(从9.0跌至3.9)。
结论:外挂工具切断模态间内在联系,原生全模态融合才是拔高AI智能上限的唯一正解。
展望:通往通用AI助理的三大黄金赛道
OmniGAIA揭开了现有全模态大模型在长程推理与多轮工具使用上的短板,而OmniAtlas为开源社区指明了一条演进路线。研究团队指出,未来有三大方向:
- 全模态智能体强化学习:在真实全模态反馈下直接优化长视野决策策略。
- 全模态MCP生态:为全模态智能体接入更多工具,打造可扩展的MCP工具集。
- 全模态具身智能:将“全模态大脑”引入物理世界,完成真实交互,打造生活中的AI助手。
看得清、听得懂只是起点,会思考、善用工具、能行动才是迈向AGI的试金石。OmniGAIA和OmniAtlas的发布,为这一目标奠定了坚实基础。





