一支15人华人团队,如何用“会推理”的图像模型杀进全球前三?

导语:一支不到15人的华人团队,凭借“会推理”的图像模型Uni-1.1,在盲测榜单中杀入全球前三,价格却只有对手的一半。

一支不到15人的团队,把图像模型做到了全球第三。5月6日凌晨,Luma AI正式宣布开放 Uni-1.1 API。几乎同一时间,由第三方机构Arena.ai发布的图像生成榜单完成最新一轮“大洗牌”——Luma凭UNI-1.1与UNI-1.1-Max直接冲进全球前三,仅次于OpenAI(gpt-image-2)和Google(nano-banana-2)。

15人华人团队打造AI生图黑马Uni-1.1:全球第三,价格砍半 | Luma AI

这个排名的含金量不言而喻:Arena.ai采用用户盲测投票产生的ELO评分系统,每张图由真实用户在不知模型来源的情况下二选一投出。这意味着在真实场景下,Uni-1.1的审美与输出质量已成为OpenAI和Google之外的最优解。随API和榜单一同发布的还有两项硬指标:价格腰斩,2K分辨率单图最低$0.0404(约合人民币0.2755元),直接对标Nano Banana级别模型砍半。这已不仅是关于“图画得好不好看”的讨论。

推理与生成,住在同一个模型

许多人初看Uni-1,以为它只是又一个图像模型。但Luma这次发布的真正卖点,并不在像素质量本身,而是它将推理(reasoning)和生成(generation)融于一体。传统图像模型的工作流是:用户写prompt → 模型直接出图 → 不满意 → 换prompt重抽。整个过程里,模型“理解了什么”和“画了什么”是两件事。企业用这类AI工具做品牌投放时,最大痛点是不可控:同一角色下一张图就变样、品牌色每次漂移、跨市场素材风格各跑各的。

而Uni的架构改变了这一点。它采用decoder-only自回归Transformer,文本token与图像token共享同一个序列——也就是说,模型不是先翻译再画,而是同时跨模态推理;构图、空间、品牌一致性这些约束,在像素生成之前就已在结构层面被求解。

15人华人团队打造AI生图黑马Uni-1.1:全球第三,价格砍半 | Luma AI

API层面的体现就是两个端点:Reasoning端点解构指令、规划构图、锁定品牌/角色/产品约束;Generation端点在推理结果之上完成像素渲染。这套设计把创意可控性从prompt工程的玄学,变成了一组能写进生产pipeline的API契约。Luma并未把Uni-1.1当作开发者玩具发布,而是直接亮出企业客户名单:Publicis将Luma Agents(基于Uni-1.1)部署到从策略、创意开发到生产的全流程;Adidas、Mazda将Uni-1.1接入品牌内容生产流水线,用于跨市场视觉素材的批量生成与一致性维护。

三个最先被产业验证的应用方向

从已落地的客户案例倒推,Uni-1.1 API在以下三个方向上,已经有了清晰的ROI模型:

品牌跨市场素材生成

传统流程要重拍、重P、重做合规审查,单条预算从几万到几十万美元不等。Uni-1.1单次API调用支持最多9张参考图联合输入,把品牌主形象、文字、产品、地域元素作为模型层级的硬约束传入,多语言渲染(含中文、阿拉伯文等非拉丁字符)一次到位。Publicis案例里40小时 vs 一年的差距,就是从这里挤出来的。

电商产品图实时生成

电商场景的痛点是量大、SKU杂、还要保证产品本体一致。开发者可以把产品照、面料样、场景参考一并喂给API,单图成本最低$0.0404,做到按页/按用户/按地域实时生成产品图,而不是一次拍完反复套模板。Luma官方将这种用法称为reference-grounded brand workflows at scale,即参考图作为模型级约束,把视觉身份锁在所有channel里。

虚拟角色连贯生成

游戏美宣、漫画、影视前期、虚拟代言——这些场景需要同一个角色穿越不同场景、姿态、光线,但身份信息必须稳如老狗。Uni-1.1的多参考图机制+句子级编辑(按句改图,默认保留其他元素),让这件事可以做成确定性流水线,而不是反复抽卡赌运气。

能力速览:三个例子,看懂边界

2036年AI新闻网站:一次推理生成可读版面

Prompt要求生成一个2036年的新闻网站页面,专为AI agent设计。Uni-1.1单次推理生成了整页可读的新闻网站,而非传统模型“远看OK、近看全是乱码”的效果。复杂版面+长文本任务在传统pipeline中需多个模块联合完成,Uni-1.1将它们捏在了一次推理里。

15人华人团队打造AI生图黑马Uni-1.1:全球第三,价格砍半 | Luma AI

多参考图融合:语义级组合

两只猫+一位真人+Luma logo,4张参考图融合成一个有逻辑的会议场景。GPT Image 1.5把参考图当贴图直接嵌入,Uni-1在语义层面完成了融合,这正是品牌campaign里产品+代言人+场景+logo组合最常见的需求。

15人华人团队打造AI生图黑马Uni-1.1:全球第三,价格砍半 | Luma AI

句子级编辑:像改文档一样迭代视觉

去掉前面那只熊→加一个黑色布帘→改成黑白照片,三轮指令叠加,主体一致性和空间关系在每一轮都没崩。这是按句编辑在生产环境里最值钱的能力,产品经理可以像编辑文档一样迭代视觉。

15人华人团队打造AI生图黑马Uni-1.1:全球第三,价格砍半 | Luma AI

(注:Uni-1.1还支持中文文字渲染、UV贴图、草稿转漫画、风格迁移、跨年龄角色故事板等更多场景。)

价格:把图像生成的边际成本打到地板

API直接提供两档计费:Build计划(按量计费)和Scale计划(预留吞吐,最低8单元起订)。Luma官方表示,价格与延迟均不到同类模型的一半——这一点已在第三方榜单和早期接入客户的成本对比里被证实。SDK覆盖Python/JavaScript/TypeScript/Go/CLI,从platform.lumalabs.ai拿key即可接入。

团队不到15人,干到全球第三:DDIM之父&CVPR最佳论文作者带队

Uni-1的核心研究团队不到15人,由两位华人学者领衔:宋佳铭(Jiaming Song),清华本科、斯坦福博士,代表作DDIM(Denoising Diffusion Implicit Models)是扩散模型采样加速的奠基工作之一,被Stable Diffusion、DALL·E等系统广泛采用;沈博魁(William Shen),斯坦福本科及博士,代表作获CVPR 2018 Best Paper Award和RSS 2022 Best Student Paper Award。一位深耕“生成”,一位精于“理解”。这种互补阵容恰好对应了Uni-1.1“脑手合一”的架构,让模型在落笔画图之前,先学会像人类一样思考构图和品牌逻辑。

在Google、OpenAI主导的图像赛道里,一支不到15人的团队,把API定价压到同行一半,还顺便在Arena.ai上完成对一众大厂的“越级反杀”,是这次发布另一个值得关注的产业信号。API发布前后,Luma团队在X平台上贴出短评:宋佳铭说:“我们用的算力规模可能会让你感到意外。为我们团队感到骄傲。(稍微更详细的报告,很快会发布。)”沈博魁说:“UNI-1的首发,让我们成了除OpenAI与Gemini App之外排名最高的实验室。对一个第一代统一图像模型来说,这个起点不算差。”而Luma模型产品lead Barkley Dai则称:“Luma现在是Arena.ai第三名了。GPT-Image 2级别的智能,Midjourney级别的审美,价格只有Nano Banana的零头。”潜台词是,Uni-1.1是Luma统一智能路线的第一代产品,却以第一代身份直接干到第三,将价格压到同类一半。

下一步:从图像到“看说推想”的连续流

按照Luma的路线图,Uni-1.1只是统一智能的第一代落地形态。下一步,他们会把这套统一框架从静态图像扩展到视频、语音和交互式世界模拟,实现从“用语言思考,用像素想象与渲染”到更广阔的多模态连续流。

© 版权声明

相关文章

暂无评论

none
暂无评论...