告别繁杂工具流!Meta联合港中文提出ATLAS:用单个Token重塑低功耗视觉推理 Meta ATLAS视觉推理方案针对多模态大模型开销大、依赖工具的痛点,创新提出用单个Token统一Agent动作与隐式思考。该方案通过SFT与LA-GRPO机制,在不改动原架构下,显著降低推理成本... AI 前沿动态# ATLAS# LA-GRPO# 多模态大模型 2个月前270
多模态大模型能理解视频笑点吗?v-HUB基准揭秘AI幽默理解的四大短板 上海交大等团队发布v-HUB基准,评测7款多模态大模型对无台词搞笑视频的理解力。研究发现模型严重依赖文字描述,难以从视频中直接捕捉动作、声音与反差,幽默解释仍存关键短板。 AI 前沿动态# ACL 2026# Gemini# GPT-4o 2个月前420
当AI学会“视觉规划”:EAR范式首次系统评测图像编辑模型的推理潜力 上海交大与BIGAI提出EAR范式,将视觉规划任务转化为单步图像编辑,通过AMAZE基准系统评测模型的视觉推理能力,揭示扩散模型潜力与差距。 AI 前沿动态# AMAZE基准# EAR范式# Maze 2个月前310