多模态大模型能理解视频笑点吗?v-HUB基准揭秘AI幽默理解的四大短板
导语:多模态大模型真能看懂搞笑视频吗?最新研究构建v-HUB基准,通过卓别林默片和短视频,揭示了AI在视频幽默理解上的四大短板。
多模态大模型:识图容易,识幽默难
如今,GPT、Gemini、Qwen 等多模态大模型已能看图、观视频、听声音。跌倒的人、把球推进洞里的猫、车门与喇叭合奏出的“停车场交响乐”——这些内容似乎只需模型识别物体、动作和声音,就能顺带理解哪里好笑。但真的是这样吗?对多模态大模型而言,看见画面等于理解幽默吗?幽默远非物体识别。一个人摔倒为何好笑,一块蛋糕切开后为何像聊天气泡,一段背景音乐为何让画面更梗——这些都需要模型同时理解动作、时序、常识、文化背景,以及视觉与声音的配合。
为探索这一问题,来自上海交通大学、武汉大学和北京通用人工智能研究院的研究团队构建了全新评测基准 v-HUB,系统分析当前多模态大模型的视频幽默理解能力。论文、项目主页与相关资源均已开放。
v-HUB:一个专注视觉幽默的评测基准
过去许多视频幽默数据集依赖台词、字幕或文本描述,模型看似理解幽默,实则常在依赖语言线索。但这与真实世界并不一致——人类并不总靠对白才会笑。幽默更常藏在反差、时机、常识违背、文化背景和声音氛围里。
例如,翻纸时纸上的小人随翻动“演奏”起来;或声称要做一个和聊天界面“一模一样”的蛋糕,结果切开后真的还原了聊天气泡。这类笑点不靠台词,而是靠视觉结构、时序、音乐与常识共同完成。v-HUB 关注的正是这类更难的问题:当笑点主要来自视觉和环境声音,而非对话与字幕时,模型还能否理解?
研究团队从两个互补来源收集视频:1914-1938年间卓别林默片中的幽默片段,以及互联网用户生成的搞笑短视频。前者强调经典肢体喜剧和视觉叙事,后者补充现代场景、文化语境和表达方式。数据筛选时,只保留时长5-60秒、笑点完整的视频,剔除低质量、有害或高度依赖语音的内容,并通过人工与自动转写尽量减少语音依赖。最终数据集包含1218条视频,总时长约4.7小时,平均每条约14秒。其中267条来自卓别林默片,951条为用户生成短视频。数据集涵盖纯视觉、视觉+声音、视觉+文字、视觉+声音+文字四种模态组合,覆盖5种幽默类型和6类文化区域背景。
每条视频都经过多轮人工标注,标注内容包括幽默等级、描述性标题、创意标题、视频描述、幽默解释、背景知识、幽默元素,以及是否存在视觉文字。基于标注结果,团队设计了三类任务:Caption Matching(标题匹配)、Humor Explanation(幽默解释)和Open-ended QA(开放式问答),全面评测模型的从观察到解释的全过程能力。
四大核心发现:模型离真正“懂笑”还有多远
研究者评测了7个前沿模型:Gemini-2.5-Flash、GPT-4o、Qwen2.5-VL (72B)、Intern3.5-VL (8B)、Video-SALMONN-2 (7B)、MiniCPM2.6-o (8B)和Qwen2.5-Omni (7B),得出以下关键结论:
发现一:文字依赖严重,原始视频表现骤降
模型在Text-Only设置下普遍表现更好,即当人类把视频内容写成详细文字描述后,模型的语言推理能力能顺利发挥。但换成原始视频输入,表现明显下滑。例如在Open-ended QA任务上,Qwen2.5-VL的SentBERT得分从Text-Only的0.760降至Video-Only的0.445。可见模型并非完全不会推理幽默,而是非常依赖别人先将视频“翻译”成文字,真正的难点在于从原始画面中捕捉细微动作、时间关系和反差。
发现二:能答题,却不等于会主动发现笑点
模型在开放式问答上的表现往往优于幽默解释任务。Text-Only设置下,Qwen2.5-VL的得分从Open-ended QA的0.760降至Humor Explanation的0.543。开放式问答将注意力指向具体事实(如“猫对球做了什么”),而幽默解释需要模型自行判断哪个动作、声音或反差才是笑点。就像一个人能回答“画面里有一只猫”,但并不代表他理解“猫像台球高手一样把球推进洞里”为什么好笑。
发现三:声音有帮助,但无法弥补视觉理解短板
加入环境声音后,部分全模态模型的性能有所提升。例如MiniCPM2.6-o在Caption Matching上从Video-Only的0.362提升至Video+Audio的0.442;Qwen2.5-Omni也从0.553提升至0.617。这说明背景音乐、音效和节奏本身就是理解幽默的一部分,能帮助判断动作节奏、意外时机,甚至补充文化线索。但Video+Audio的整体表现仍远落后于Text-Only,表明现有模型尚未将视觉与声音真正融合为稳定的幽默理解能力,更多只是获得一点额外提示。
发现四:视觉文字、背景知识与时代语境都是隐形线索
包含视觉文字的视频更容易被模型理解。当声音不能直接贡献笑点时,屏幕文字成为重要补充。例如Gemini-2.5-Flash在Caption Matching上准确率从0.569升至0.715。背景知识同样关键:对于需要外部信息的视频,显式提供背景信息能提升解释能力。例如Qwen2.5-Omni在Video+Audio设置下,提供背景知识时Humor Explanation得分0.512,否则仅为0.459。此外,模型理解当代短视频比理解早期默片幽默更容易,卓别林式默片因高度依赖肢体表演、时代语境和经典喜剧结构,对模型反而更难,证明视频幽默还牵涉文化、年代和表达习惯。
三个典型失败案例
案例一:猫打台球——丢失的细微动作
小猫用爪子抓住球并放进洞里,人类因拟人化和反差感而发笑。在Caption Matching任务上,模型在各种输入设置下都能答对;但在Open-ended QA任务上,只看视频时却回答“小猫没有和球互动”,加入声音后仅简短说“推了一下”。这说明模型可能通过局部线索或选项排除猜中标题,但并未稳定理解关键动作。
案例二:停车场“交响乐”——声音融合的挑战
两人在车旁开关车门,用车门声和喇叭声制造出混乱而有节奏的“停车场合奏”。只看视频时,模型Caption Matching回答错误,误解为其他场景;加入声音后才选中与“parking garage symphony”相关的正确标题。但Open-ended QA中模型仍可能将动作描述为“说话”或“推车”,可见声音能帮助捕捉氛围,却未自动修正视觉动作识别错误。
案例三:免费WiFi——视觉文字与场景语义的隔阂
一张“FREE WIFI”告示寻常无奇,镜头拉远后墙上的密码长到几乎贴满整面墙。笑点来自“人人可用免费WiFi”与“密码长到无人愿输”的反差。只看视频时,模型认为“WiFi不能用”;输入信息越充分,答案越接近“密码太长”。这凸显了视觉文字与场景语义结合的难度。
结语:AI 离“会笑”还有多远?
当前视频理解评测多关注动作识别、事件描述与事实问答,但幽默理解更进一步:要求模型知道何为正常、何为意外,以及为何意外值得一笑。v-HUB的结果显示,今天的多模态大模型能看见很多东西,也能在提示充分时解释部分笑点,但人类式幽默理解往往发生在无提示的瞬间——看到一个动作、听到一个声音、读到一行字,立刻意识到“不对劲但很好笑”。这一步仍是模型的短板。未来AI若要更自然地陪伴、协作和交流,不仅要看见世界,更要理解人类为何会对某个场景产生情绪反应。