多模态大模型能理解视频笑点吗?v-HUB基准揭秘AI幽默理解的四大短板 上海交大等团队发布v-HUB基准,评测7款多模态大模型对无台词搞笑视频的理解力。研究发现模型严重依赖文字描述,难以从视频中直接捕捉动作、声音与反差,幽默解释仍存关键短板。 AI 前沿动态# ACL 2026# Gemini# GPT-4o 2个月前420