仅15人团队,价格低至4美分,Luma Uni-1.1图像模型杀入全球前三,文字渲染直逼GPT-Image 2

导语:Luma Uni-1.1杀入图像生成榜前三,文字渲染媲美GPT-Image 2,单图成本仅4美分,背后是一支不到15人的精锐小团队。

突然杀出的黑马:Luma Uni-1.1 拿下图像生成榜第三

2025年,图像生成模型的军备竞赛似乎已进入“巨头主导”的节奏,但一支不到15人的小团队却用一款第一代产品打破了格局。Luma 公司刚刚开放 API 的 Uni-1.1 模型,在第三方盲测平台 Arena 的图像生成榜单上,Uni-1.1 与 Uni-1.1-Max 双双进入实验室榜前三,排名仅次于 OpenAI 和 Google,将 Microsoft AI、xAI、Reve、阿里、Black Forest Labs、腾讯与字节跳动等大厂甩在身后。

Luma Uni-1.1:图像生成模型杀入前三,文字渲染直逼GPT-Image 2,API低至0.04美元

更令人咋舌的是其定价:单图最低仅需 0.0404 美元,不到同类模型价格的一半。Luma 首席科学家宋佳铭在 X 平台直言:“我们用来做到这一点的算力,可能会让你大吃一惊。”这款被官方定义为“第一代统一图像模型”的产品,既不像 DALL·E 那样背靠云巨头,也不似 Midjourney 依赖社区美学迭代,它靠的是一条“理解与生成合二为一”的技术路线。

复杂版面、中文海报、工程图:Uni-1.1 凭什么当上生产工具?

过去评判图像模型,往往只看“图好不好看”,但 Uni-1.1 更想证明的是:在结构化长版面、多对象一致性、多轮编辑这些真实工作流场景中,它能否像一台可靠的机器那样稳定输出。我们直接来看四组极具挑战的任务。

1. 直出一整张新闻网站主页:“远看精美,近看没有乱码”

Luma Uni-1.1:图像生成模型杀入前三,文字渲染直逼GPT-Image 2,API低至0.04美元

提示词要求生成一张2036年的新闻网站,内容面向进化为不同人格的 AI 智能体,且所有文字必须为英文。Uni-1.1 单次生成的结果可以直接当作网页设计稿:导航栏、头条、分栏、广告位一应俱全,所有文字清晰可读,没有出现过去图像模型常见的“乱码”伪文字。整页的逻辑布局与商业网站别无二致,满足了“生产级视觉交付”的第一关。

2. 黑洞蓝图:极小字标注+工程制图风格

Luma Uni-1.1:图像生成模型杀入前三,文字渲染直逼GPT-Image 2,API低至0.04美元

切换到蓝晒图风格后,Uni-1.1 要在同一张图里完成多重语义层:银河系中心黑洞 Sagittarius A* 的横截面结构、Schwarzschild Radius、Event Horizon、Photon Sphere 等科学标注、底部图例、分类水印,甚至右下角的“DRAWING NO. / SCALE / DATE / REF”工程表格。所有微小文字归位准确,视觉风格统一,仿佛出自专业绘图软件之手。这正是“风格一致性+多语义层并行”的典型用例。

3. 22枚火箭等比例对比:多对象+比例控制+标签正确

Luma Uni-1.1:图像生成模型杀入前三,文字渲染直逼GPT-Image 2,API低至0.04美元

这张插画将1957年至2025年的二十余种运载火箭横向排列于同一比例尺下,每一枚都附带了型号、国家、高度数值与首飞年份标签,底部更补充了“RED OUTLINE — CURRENTLY OPERATIONAL”图例。过去,要让模型同时保持多个对象相对比例正确、标签信息不串行,通常需要牺牲某种一致性,但 Uni-1.1 一口气全拉满了。

4. 中文摄影海报:12张缩略图维持同一张脸

Luma Uni-1.1:图像生成模型杀入前三,文字渲染直逼GPT-Image 2,API低至0.04美元

中文版面对图像模型一直是巨大的考验。Uni-1.1 生成的“水·韵”海报包含主标题、副标题(中国风·水元素·影楼个人写真)、底部经营信息文字,以及12张缩略图阵列。更惊人的是,12张缩略图里的人物保持了同一角色的脸部一致性,同时服装与道具产生了合理变化。通常,这种“中文版面+角色一致性”需要依赖翻译模型、中文 LoRA 和人物参考模块协同作业,Uni-1.1 却在统一框架下一次性完成。

5. 更多生产级功能:9张参考图融合与多轮按句编辑

除了上述复杂版面能力,Uni-1.1 还开放了两项极为实用的高级功能:

  • 多参考图融合:单次调用最多支持 9 张参考图联合输入。品牌主形象、产品照、面料样、场景参考、代言人照片、logo 可一并作为模型层级的硬约束传入,所有元素在生成画面中保留各自的身份特征。Adidas、Mazda 等品牌客户已开始将其用于跨市场素材生产。
  • 多轮按句编辑:在同一个对话线程中,用户可以像编辑文档那样按句修改图像——“去掉前面这只熊”“在背景加一块黑布帘”“整体改成黑白照片”——每一轮改动只影响对应元素,其他内容跨轮稳定,无需重新撰写冗长的提示词。

技术底座:把理解与生成放进同一个Transformer

为什么 Uni-1.1 能把过去需要拼接多个模型的事情做进一个模型里?原因在于它摒弃了主流“理解侧用编码器、生成侧用扩散模型”的分立方案,转而采用统一的 decoder-only 自回归 Transformer。文本 token 和图像 token 被表示在同一个交错序列中,模型对两类 token 同时建模。构图、空间关系、品牌一致性等约束,在像素生成开始前就已经在结构层面被求解。Luma 将这套流程概括为:“先把意图想清楚,再让像素落下来”(A reasoning model that interprets intent before it generates)。

得益于此,字符级控制、多参考图约束和多轮编辑的状态保持都直接由模型内部能力驱动,无需外挂字符渲染、检测、对齐等先验模块。Uni-1.1 的 API 也对应拆分为两个端点:Reasoning 端点负责指令解构、构图规划与品牌/角色/产品约束锁定;Generation 端点在推理结果之上完成像素级渲染。前述 9 张参考图作为硬约束,正是通过 Reasoning 端点将参考图直接推入主序列,在所有通道上锁定视觉身份,使其不再依赖事后微调的 LoRA 或 IP-Adapter。

Luma 还在技术材料中透露了一个有趣的反哺现象:生成训练能够显著提升模型的细粒度理解能力。也就是说,模型通过“学着画一个东西”,反而变得更“理解这个东西”,这一发现与认知科学中的“生成式心智模型”假说不谋而合,也成为 Luma 坚持统一架构的重要动机。

定价与接入:把边际成本压到地板

Uni-1.1 API 提供两档计费方案:按量计费的 Build 和带预留吞吐的 Scale。Build 方案单图最低 0.0404 美元,Scale 计划最低 8 单元起订,主要面向品牌资产基础设施和多市场内容生产线。SDK 覆盖 Python、JavaScript/TypeScript、Go 与 CLI,开发者可在 platform.lumalabs.ai 申请密钥接入。Luma 模型产品经理 Barkley Dai 称:“Uni-1.1 实现了 GPT-Image 2 级别的智能、Midjourney 级别的审美,价格却仅为 Nano Banana 的一小部分。”

不到15人的团队与“统一智能”的未来

Uni-1 的核心研究团队规模不到 15 人,由两位华人学者领衔:宋佳铭(Jiaming Song),清华本科、斯坦福博士,其代表作 DDIM 奠定了扩散模型采样加速的基础,将采样步数从数百上千步压缩至数十步,Stable Diffusion、DALL·E 等系统因此受益;沈博魁(William Shen),斯坦福本科及博士,获 CVPR 2018 最佳论文奖、RSS 2022 最佳学生论文奖,研究覆盖三维重建与视觉表示。正是这样一支精锐小队,选择了一条与大厂截然不同的路径:用同一个模型同时搞定理解与生成,并以“第一代”之姿闯进全球前三。

按照官方路线图,Uni-1.1 只是统一智能路线的起点。下一步,这套框架将从静态图像扩展至视频、语音与交互式世界模拟,最终目标是让“看、说、推理、想象”在同一条连续流里协同完成。在图像生成赛道被算力军备竞赛裹挟的当下,Uni-1.1 提供了另一种剧本:小团队精简模型照样能挤进头部,并把价格打到行业底线。下次再有人问“图像生成是不是到顶了”,Uni-1.1 或许就是这个问题的全新答案。

——图像引用自 Luma 官方公告与第三方盲测平台 LMArena。

© 版权声明

相关文章

暂无评论

none
暂无评论...