CVPR 2026 多模态视觉新风向:不再“强行推理”,按需推理与评测体系重建成主线 CVPR 2026 多模态论文揭示视觉智能范式转变:从“始终推理”到按需推理,从选择题评测到开放问答,从单一图像理解到视频与精细定位,数据基础设施同步升级。 AI 前沿动态 3个月前480
实测 Happy Horse-1.0:阿里首款视频模型如何让 AI“听懂戏”,拍出电影级质感? 阿里ATH事业群推出Happy Horse-1.0视频模型,在Arena和Artificial Analysis盲测中名列前茅。本文通过极限压力测试,全面评测其电影级叙事能力、多镜头一致性、音画同步... AI 前沿动态 3个月前400
优必选发布Thinker Cosmos开发者社区:人形机器人落地难的“最后一公里”有解了? 优必选发布Thinker Cosmos开发者社区,通过三层生态战略(入门层、价值层、沉淀层)降低人形机器人开发门槛,推动场景落地。2025年交付1079台机器人,2026年目标5000台,家庭场景加速... AI 前沿动态 3个月前360
双榜登顶、四项全能:Motubrain如何为机器人大脑设定“干活”新标准? Motubrain在WorldArena和RoboTwin2.0双榜登顶,展现通用、连贯、预测、泛化四项全能能力,为机器人大脑的干活能力设定新标准,推动具身智能从技术验证走向产品落地。 AI 前沿动态 3个月前360
视觉逼真≠能干活!清华团队WorldArena撕开世界模型“华而不实”的假面 对话清华商宇,深度解读WorldArena评测平台如何揭示世界模型在视觉质量与功能可用性之间的巨大断层,并推动训练范式从视频生成向视频-动作联合建模转变,成为CVPR 2026关键竞赛之一。 AI 前沿动态 3个月前400
VLA 未死,类脑已至:智平方郭彦东如何用一场演讲为具身智能“纠偏” 在2026年FAIR plus大会上,智平方创始人郭彦东驳斥了“VLA时代终结”论,指出世界模型正融入VLA,而类脑架构是关键变量。本文深度解析NeuroVLA如何以0.4W功耗、20ms反应实现生物... AI 前沿动态 3个月前330
CVPR 2026|何恺明团队五连发:单步生成FID 1.72、归一化流加速700倍,流匹配全面挑战扩散霸权 何恺明团队在CVPR 2026连发五篇论文,覆盖流匹配单步生成、归一化流加速、纯视觉推理和像素自监督,多项指标刷新SOTA,无蒸馏单步FID达1.72,归一化流加速700倍,纯视觉模型推理能力比肩人类... AI 前沿动态 3个月前420
不训练模型、不重写Prompt!MILR提出测试时隐空间推理,让图像生成学会边想边改,登ICLR 2026 中科大&BIGAI提出MILR,在统一隐空间进行测试时推理,无需重训练即可大幅提升图像生成质量,在GenEval等基准达到SOTA,已被ICLR 2026接收。 AI 前沿动态 3个月前310
触觉觉醒:戴盟机器人以11万感知单元打造最大具身数据集,开启机器人“手感”时代 戴盟机器人发布全球最大含触觉全模态具身数据集Daimon-Infinity,并开源10000小时数据。联合创始人王煜教授解读VTLA架构如何赋予机器人真实手感,推动人形机器人商业化落地。 AI 前沿动态 3个月前320
AI智能体自学技能,到底行不行?CMU与亚马逊联合发布首个系统性评测基准,实验结果出人意料 卡内基梅隆大学与Amazon AGI推出SkillLearnBench,首个面向AI Agent技能持续学习的系统评估基准。覆盖6大类20任务,从技能质量、执行轨迹到任务结果多维度评测,揭示当前方法与... AI 前沿动态 3个月前330