李飞飞团队再造“动作版”ImageNet!GPT-5与Gemini遭遇滑铁卢:具身智能迎来最强空间认知考核 李飞飞团队发布具身空间智能新基准ESI-Bench,挑战GPT-5与Gemini空间推理极限。研究揭示大模型在“感知-行动回路”中的动作盲视、三维重建失真传染与致命“元认知缺陷”。 AI 前沿动态# ESI-Bench# Gemini# GPT-5 2个月前360
除夕炸场!阿里千问3.5 Plus发布:3970亿参数仅激活170亿,性能超越GPT-5.2,API价格仅为Gemini的1/18 除夕当天阿里发布Qwen3.5-Plus,3970亿参数仅激活170亿,性能超越GPT-5.2和Gemini-3-pro,API价格仅为Gemini的1/18,全栈自研打破AI不可能三角。 AI 前沿动态# API价格# Gemini# GPT 2个月前330
多模态大模型能理解视频笑点吗?v-HUB基准揭秘AI幽默理解的四大短板 上海交大等团队发布v-HUB基准,评测7款多模态大模型对无台词搞笑视频的理解力。研究发现模型严重依赖文字描述,难以从视频中直接捕捉动作、声音与反差,幽默解释仍存关键短板。 AI 前沿动态# ACL 2026# Gemini# GPT-4o 2个月前420