拆掉VAE,商汤凭8B参数重新定义开源多模态上限
导语:商汤SenseNova U1以8B轻量体量实现多模态理解与生成的原生统一,摒弃传统VAE,性能直逼闭源巨兽,正式开源。
多模态“两条腿走路”的困局,终于被打破了
长期以来,多模态的理解与生成像两条互不交汇的河流:GPT-4V、LLaVA等视觉语言模型专注理解,Stable Diffusion、FLUX等扩散模型负责生成。两者架构迥异,哪怕物理上共享部分参数,理解与生成依然是相对独立的模块接力。这不仅导致模型冗余、能力割裂,更让端到端交付成为空中楼阁。
变革的曙光出现在2025年,GPT-4o点燃了统一多模态的野望,但其图像生成仍依赖独立的DALL·E 3,本质上仍是“拼接”。真正的原生统一——用同一个大脑同时完成“看懂”与“画好”——始终是业界未竟之愿。
直到商汤SenseNova U1登场。开源一周多,GitHub突破1500 Star,冲上HuggingFace趋势榜,开发者们兴奋地发现:这个仅8B参数的模型,居然把变分自编码器(VAE)也扔掉了。

图注:该框架结合了(1)近无损视觉接口,(2)由两层卷积编码与类MLP编码层实现,以及(3)原生的混合Transformer(MoT)主干架构。架构重点在于同时解决三组矛盾:语义抽象与像素细节的共同表征、理解与生成的协同、语言因果性与图像空间一致性。
NEO-unify:原生统一架构的里程碑
SenseNova U1的核心,是商汤自研的NEO-unify架构。它彻底摒弃了视觉编码器(VE)和VAE,直接从像素和文本进行端到端学习。商汤官方打了个比方:传统架构像“说不同语言的人组成的工作组”,而SenseNova U1更像“一个从一开始就同时掌握多项技能的人”。
这一设计的颠覆性在于:VAE的压缩过程是有损的,开发者花费数年调参打补丁,而NEO-unify让像素与词语的信息从一开始就在同一个表征空间里共同参与每一层计算,消除了跨模块传递的信息损耗。从此,理解与生成不再是两个系统,而是同一认知能力的两面。
本次开源的SenseNova U1 Lite包含两个规格:基于稠密骨干网络的SenseNova-U1-8B-MoT(理解与生成分支参数约9.37B/8.19B),以及基于混合专家(MoE)的SenseNova-U1-A3B-MoT(理解分支约30.54B,生成分支约8.2B,每token激活top-8专家,实际活跃参数约3B)。
性能实测:8B模型硬刚闭源巨兽
技术报告展示了令人瞩目的数据:在涵盖理解、生成、编辑、空间智能和视觉推理的多项基准测试中,8B-MoT均达到同量级开源模型SOTA水平,甚至在部分指标上超越了大型商业闭源模型。

图注:SenseNova-U1 与其他顶级多模态理解模型在多模态基准测试上的对比。

图注:SenseNova-U1 与仅具备理解能力的顶级模型在纯文本基准测试上的对比。

图注:GenEval 上的定量评估结果。
关键数据一目了然:GenEval总分约0.91-0.92,OneIG中文文字渲染达0.977,信息图生成领先多数开放模型,多模态理解MMMU达80.55。这些数字不是来自多个专用模型的拼凑,而是同一个模型内部的统一输出。而且,统一架构带来的数据效率提升更为惊人——NEO-unify以更少的训练token,获得了比类似统一模型BAGEL更优的表现。
在生成延迟与平均性能的综合对比中,SenseNova U1 Lite的图像生成质量匹敌Qwen-Image 2.0 Pro、Seedream 4.5等大型闭源模型,推理速度却显著占优,尤其在复杂信息图生成任务中,控制力超出预期。8B的轻量体量,让它在实际部署中潜力巨大。
生产场景实战:从信息图到PPT,一个人全包
SenseNova U1在真实工作流中的表现更为直观。我们设计了一系列任务来检验它的图文思考和结构化生成能力。
连续图文创作: 要求模型绘制云南水彩风景画,并逐步展示从线稿到上色完稿的过程。SenseNova U1不仅准确理解了要求,还进行了逻辑连贯的输出,画面信息始终保持一致。
多镜头分镜设计: 为一座建筑群设计7步分镜,覆盖从二维底图到好莱坞级CG效果的人视街景。图文交错生成、带图思考的连贯性令人印象深刻。
信息图生成: 制作一份5月院线电影观影指南。这是一项信息密度极高的任务,每部电影的片名、日期、主题标签都必须清晰可读。模型不仅保证了文字渲染的高准确率,还在高密度的约束下维持了杂志级的排版审美——平面设计师的排版力与产品经理的信息架构能力,在此合二为一。
更进一步,我们让它生成了一份《甄嬛传》“滴血验亲”情节的信息图,并将关键台词融入设计。两份信息图均无模板痕迹,每一页都根据内容密度自适应,字体、颜色、元素比例协调,异构素材的知识合并与逻辑叙述自然流畅。曾经手搓信息图和PPT的技能,或许正被AI悄然取代。
5分钟部署:ComfyUI集成与多种优化版本
SenseNova U1的开源生态极速扩张。部署仅需几步:
# 进入ComfyUI custom_nodes目录
cd ComfyUI/custom_nodes
# 克隆官方仓库
git clone https://github.com/OpenSenseNova/SenseNova-U1
# 安装依赖(推荐uv)
uv pip install -r requirements.txt
# 配置API Key(本地推理可跳过)
export SENSENOVA_API_KEY=your_key_here
# 启动ComfyUI,拖入workflow_demo.json即可运行
硬件要求:推荐16GB显存,但GGUF量化版本支持8GB显存运行,并可通过layer-offload模式进一步降低占用。团队还同步推出了8步推理加速版、LoRA微调版等,社区迭代速度极快。
统一架构的深远意义:不止于降本增效
过去一年,多模态理解侧的能力已高度趋同,但生成侧始终是短板。GPT系列理解一流却依赖独立生成模块,Qwen-VL开源生态庞大却以文本输出为主,DeepSeek-V4的多模态生成也非核心卖点。SenseNova U1的差异化在于:在8B的级别上率先实现了理解与生成的原生融合,一己之力将多模态竞争拉到了底层架构创新的高度。
消融实验明确证实,原生像素-文本接口能同时保留语义和像素信息,即便冻结理解分支,生成路径仍能恢复细节并完成较好的图像编辑。MoT混合专家架构让理解与生成协同而非冲突,数据效率显著提升。单一模型替代专用模型协作范式,不仅降低了存储、计算和部署成本,更打开了真原生架构通往AGI的想象空间。正如报告所言,多模态的未来,不在于规模的无休止扩大,而在于深度融合的架构变革。SenseNova U1,或许正是这条路上的关键里程碑。