何恺明首秀语言模型ELF!同天清华开源MiniCPM-V 4.6:小模型掀翻千亿参数,AI步入效率为王

导语:同日两件大事:何恺明首秀语言模型ELF,清华开源MiniCPM-V 4.6,宣告AI步入效率为王时代。

5月13日,AI领域同日爆出两件大事:顶级CV学者何恺明携MIT团队发布人生首个语言模型ELF,清华系面壁智能开源新一代“小钢炮”MiniCPM-V 4.6。两者不约而同指向同一个趋势:AI正从“堆算力”转向“省算力”,小模型以极致效率掀翻千亿参数。

何恺明ELF与清华MiniCPM-V 4.6同日发布,小模型时代效率为王

算力降维:从“堆H100”到“一张4090就够了”

MiniCPM-V 4.6仅1.3B参数,在Artificial Analysis智能指数上拿下13分,超越Qwen3.5-0.8B整整3个点,但推理token消耗仅为后者的1/19(非推理版)和1/43(推理版)。在256并发、1000张图像的高压测试下,单张RTX 4090吞吐量比Qwen3.5-0.8B高出1.6倍。这意味着别人做1次推理,它能做43次。一张消费者级RTX 4090即可部署,无需H100或A100。一位前Meta与Momenta现具身创业者表示:“大多数用户需要的是随时响应、不掉线的模型,而非能写论文的模型。”高通负责人亦指出:“参数越少,越容易在本地微调,适配个人习惯。个人AI时代,模型只需记住你一个人。”

何恺明ELF与清华MiniCPM-V 4.6同日发布,小模型时代效率为王

架构换道:从“预测下一个词”到“连续空间扩散”

何恺明的ELF走了一条与GPT全然不同的路——全程在连续embedding空间里做扩散,最后一步才离散化为文字。现有扩散语言模型虽名为“扩散”,实则在离散token空间操作,未发挥连续优势。ELF像雕塑般从整块石料中磨去多余部分,最后才刻细节,全局统筹效率更高。105M参数、45B训练token、32步采样即超越现有DLM方案,无需蒸馏。与此同时,MiniCPM-V 4.6采用LLaVA-UHD v4架构,视觉编码器计算量降低约50%,处理3136×3136高分辨率图像在RTX 4090上仅需75.7ms。从“预测下一个词”到“连续空间去噪”,从云端到端侧,大模型正被精巧的分工系统取代。

何恺明ELF与清华MiniCPM-V 4.6同日发布,小模型时代效率为王

三项变化印证轻量化浪潮

  • 端侧AI从概念到标配:MiniCPM-V 4.6已能在手机上离线运行。2026下半年,更多手机厂商将把端侧模型作为卖点。
  • 架构创新打破Scaling Law垄断:ELF证明语言模型不必自回归,MiniCPM证明1.3B也能打。“越大越好”正在失效,“够用且够快”成为新准则。
  • 商业模式转向成本优化:企业不再盲目追大,智能客服、文档辅助等场景倾向轻量级定制模型,推理成本仅为超大模型的数十分之一。

何恺明ELF与清华MiniCPM-V 4.6同日发布,小模型时代效率为王

何恺明下场做语言模型,面壁开源第五代端侧模型,高通押注个人AI——这些不是孤立的新闻。它们共同宣告:AI轻量化浪潮的序幕已拉开。未来的AI不再是“越大越好”,而是“在足够聪明度下,越轻越贵”。如何做出更好的小模型,或许才是2026年AI行业最值得关注的方向。

© 版权声明

相关文章