告别繁杂工具流!Meta联合港中文提出ATLAS:用单个Token重塑低功耗视觉推理Meta ATLAS视觉推理方案针对多模态大模型开销大、依赖工具的痛点,创新提出用单个Token统一Agent动作与隐式思考。该方案通过SFT与LA-GRPO机制,在不改动原架构下,显著降低推理成本...AI 前沿动态# ATLAS# LA-GRPO# 多模态大模型4个月前420
多模态大模型能理解视频笑点吗?v-HUB基准揭秘AI幽默理解的四大短板上海交大等团队发布v-HUB基准,评测7款多模态大模型对无台词搞笑视频的理解力。研究发现模型严重依赖文字描述,难以从视频中直接捕捉动作、声音与反差,幽默解释仍存关键短板。AI 前沿动态# ACL 2026# Gemini# GPT-4o4个月前550
当AI学会“视觉规划”:EAR范式首次系统评测图像编辑模型的推理潜力上海交大与BIGAI提出EAR范式,将视觉规划任务转化为单步图像编辑,通过AMAZE基准系统评测模型的视觉推理能力,揭示扩散模型潜力与差距。AI 前沿动态# AMAZE基准# EAR范式# Maze4个月前450