别只顾着拼像素了!浙大阿里开源新架构,让AI学会“先三思后动笔” Unified Thinker图像生成推理方案攻克了扩散模型在复杂逻辑生成上的硬伤。针对AI绘制数独、模拟时间演变频频幻觉的痛点,浙大与阿里团队提出解耦思考与执行的模块化思维链架构,实测表明该方案能够... AI 前沿动态# Unified Thinker# 图像生成推理# 多模态大模型 2个月前300
免费开源!快手Keye-VL-2.0-30B大模型上线:手把手教你白嫖256K超长视频理解与代码Agent Keye-VL-2.0-30B-A3B是快手开源的全新一代多模态大模型底座。它引入了DSA机制以极低推理成本支持256K超长上下文,并首次解锁Code与Tool等Agent协作机制,提供优秀的时序因果... AI 前沿动态# Agent# Keye-VL-2.0# 多模态大模型 2个月前360
告别“废话连篇”的推理!浙大等提出Heima框架:大模型用3个隐式Token看懂世界 多模态大模型在依靠CoT推理时,文本冗长极易增加硬件解码延迟。为此,浙大等提出Heima推理框架,将复杂的显式步骤压缩成少数隐式思考Token。实测表明,该方案成功在隐空间实现极速探索,不仅免去了海量... AI 前沿动态# CoT压缩# Heima# ICML2026 2个月前340
给视频生成装上“物理外脑”:NTU团队提出VChain,用视觉推理解决画面“穿帮”难题 视频生成模型常因缺乏物理常识导致画面穿帮。南洋理工大学团队推出VChain框架,首次引入“视觉思维链”机制。该方案利用多模态大模型进行逻辑推演并指导视频生成,在常识与因果规律测评中表现优异,零重训实现... AI 前沿动态# VChain# 多模态大模型# 大模型推理 2个月前370
读懂音乐时间线到底有多难?复旦与字节联手打造GaMMA,多模态大模型终于学会“按秒听歌” 音乐时序理解一直是多模态大模型的致命短板。复旦联合字节推出GaMMA模型,创新采用双编码器融合网络与GRPO强化学习,让大模型真正读懂音乐时间线。实验表明,它在音乐结构拆解与时序任务上超越Gemini... AI 前沿动态# GaMMA# GRPO强化学习# 多模态大模型 2个月前370
告别繁杂工具流!Meta联合港中文提出ATLAS:用单个Token重塑低功耗视觉推理 Meta ATLAS视觉推理方案针对多模态大模型开销大、依赖工具的痛点,创新提出用单个Token统一Agent动作与隐式思考。该方案通过SFT与LA-GRPO机制,在不改动原架构下,显著降低推理成本... AI 前沿动态# ATLAS# LA-GRPO# 多模态大模型 2个月前270
AI下半场拼什么?CVPR 2026顶级论文干货来袭,去北京听作者聊透多模态与三维具身 CVPR 2026论文分享会蓄势待发。面对跨模态推理低效与三维数据匮乏的学术痛点,本次北京分享会由行业顶尖学者现场拆解隐空间统一模型与生成式视觉先验两大方案,助力研发者攻克多模态对齐与具身控制难题,提... AI 前沿动态# CVPR2026# 世界模型# 具身智能 2个月前300
告别视觉幻觉!首个多模态并行思考框架开源:以“宽度”破局,让VLM学会分头行动 视觉语言模型在长推理时易发生注意力漂移并产生幻觉。为此,最新研究提出首个并行思考框架Visual Para-Thinker,引入并行注意力与分段学习位置编码机制。实验显示该框架显著提升了多模态模型在视... AI 前沿动态# Visual Para-Thinker# 多模态大模型# 并行思考 2个月前390
72.6分横扫VSI-Bench!GeoThinker开源:从被动融合到主动感知,打造空间推理新王者 中山大学与引望联合提出GeoThinker,通过主动几何集成框架突破传统被动融合瓶颈,在VSI-Bench上以72.6分登顶,并在具身与自动驾驶任务中展现强大性能。 AI 前沿动态# GeoThinker# VSI-Bench# 中山大学 2个月前320
AI不再“近视眼”:上交大&蚂蚁提出R2I蒸馏,单次推理实现细粒度感知,速度提升10倍 上海交通大学与蚂蚁集团联合提出Region-to-Image Distillation方法,让多模态大模型无需反复缩放即可实现细粒度视觉感知,性能超越Kimi-K2.5等大模型,速度提升10倍。 AI 前沿动态# AI视觉# ZwZ# 区域到图像蒸馏 2个月前310