多模态与扩散模型也配上高效对齐了:VeRL-Omni 如何啃下 RL 后训练这块硬骨头?
导语:多模态与扩散模型迎来专属RL后训练利器,VeRL-Omni如何打破显存与算力双重枷锁?
在大语言模型(LLM)的世界里,通过强化学习(RL)进行对齐——无论是标准的PPO,还是近年来走红的DPO与GRPO——早已成为让AI理解人类意图的标配手段。然而,当我们把视线移向图像生成、视频演绎或统一图文理解的多模态领域时,这一套RL对齐方法却玩不转了。扩散模型与全模态架构在计算特征、显存占用和生成逻辑上,与文本 token 有着天壤之别,直接生搬硬套 LLM 的 RL 训练栈,往往会导致显存瞬间“红屏”,训练吞吐量低得难以容忍。为了打破这个瓶颈,开发者们亟需一套原生的、能够兼容连续latent空间去噪轨迹且高吞吐的后训练利器。
最近开源的 VeRL-Omni 正好扮演了这一破局者的角色。这套由 verl 团队在 verl 与 vllm-omni 基础之上精心构建的通用多模态 RL 后训练框架,涵盖了对扩散 Transformer(如 Qwen-Image)、混合 AR-DiT 架构(如 Qwen-Omni)以及 BAGEL、HunyuanImage-3.0 等统一理解与生成架构的全面支持。

(注:以上为 VeRL-Omni 的整体技术架构示意图,展示了其如何在非自回归与多模态流中穿梭)
多模态模型的强化学习后训练,到底难在哪?
想要给多模态生成模型套上强化学习的缰绳,面临的挑战远比纯文本对齐要棘手得多。这主要体现在以下几个维度:
- 异构的 Rollout 轨迹生成: 与 LLM 吐出离散序列 token 的过程不同,扩散或多模态生成模型在 rollout 阶段执行的是连续隐空间(latent space)里的去噪操作。不仅如此,整个流水线常常涉及多个异构组件的联接(例如从 Text Encoder 到 DiT,再到最后的 VAE 解码)。这意味着底层的推理引擎必须极其灵活,才能兼容如此复杂的“异构多阶段”生成流程。
- 高昂的显存开销与调度博弈: 多模态模型的生成峰值显存本就居高不下,更麻烦的是,多模态 RL 的“裁判”(即评估生成质量的奖励函数)通常也是庞大的多模态模型(如 VLM-as-judge 或是 OCR scorer)。在有限的显卡资源里,既要跑高吞吐的网络生成,又要挤出空间来运行大参数量的裁判模型,这给分布式调度带来了近乎灾难性的复杂性。
- 极度依赖高效的多模态 Rollout: 由于多模态生成是计算大户,框架必须深度集成像 vLLM-Omni 这样的异步高吞吐多模态生成 serving 引擎,结合 step-wise continuous batching 以及 embedding cache 等性能魔改,才能在保证精度的前提下,把训练总时长压缩到可用区间。
模块化解耦:VeRL-Omni 如何见招拆招?
为了让开发者不用再重复造轮子,VeRL-Omni 在底层架构设计上做出了以下关键突破:
- 极致灵活的奖励评估引擎: 不仅支持常规的规则判定,更能通过 vLLM 高效调度各类 VLM 奖励模型。尤为出色的是,这套框架实现了奖励计算(Reward computation)与模型 rollout、后台训练在时间线上的并行重叠(overlap),极大地压榨了 GPU 闲置空档。
- 模块化训练后端与高兼容度: 内置 DiffusersFSDP、Megatron 以及全新的 VeOmni 等 trainer,支持 FSDP、USP、TP 等多种并行策略的任意切换。更重要的是,它同时支持 NVIDIA GPU 与国产自研的昇腾 NPU 后端,提供了对多硬件的极佳包容性。

(通过 verl-omni.readthedocs.io 即可获取最新的快速开始指南与配置说明)
实战演练:如何用 FlowGRPO 驯服 Qwen-Image?
为了展示实实在在的工程优化成效,项目团队公开了一个极具启发性的演示案例:基于 OCR 奖励任务进行 Qwen-Image 的后训练调优。在该任务中,团队使用容量为 8B 的 Qwen3-VL-Instruct 作为奖励裁判模型,通过读取 Qwen-Image 实时渲染生成的图像并与其地标文本(Ground Truth)进行比对,对图像中的文字渲染质量进行精准评分。
从算法层面来看,FlowGRPO 是一种专门针对 Flow-matching 模型的在线策略算法。它在逻辑上被解构为四个紧密咬合的闭环步骤:
- 主动探索(Rollout Generation): 扩散 Policy 模型在多步 SDE 采样中收集去噪轨迹并保存 log probability 与生成图像。
- 优势估计(Reward Scoring): 利用部署在大模型上的“裁判”给图像质量和文字排版打分,进而转换为 trajectory advantage 优势值。
- 策略跃迁(Policy Optimization): 运用类似 CLIP 风格的 FlowGRPO 损失函数对当前策略执行轻量却高效的梯度更新。
- 权重同步(Weight Synchronization): 在极短的步数周期内,把最新训练好的策略参数实时同步回 Rollout 节点,保证下一步的主动探索能踩在更好的起跑线上。
吞吐量与实测性能:每一步都用在刀刃上
在分布式硬件资源调度中,任何微小的同步阻塞都是极大的算力浪费。为此,VeRL-Omni 团队在 NVIDIA H800 GPU 集群上做了深度的吞吐量压力测试。

测试数据给出了振奋人心的结论:如果我们将昂贵的“裁判大模型”拖入到主训流程里混用资源,会造成频繁的同步等待;而一旦启用 VeRL-Omni 的异步交叠特性,将奖励模型放到独立的 GPU 资源上跑,每一步的 wall-clock(实际耗时)能够直接降低约 14%。
针对更大型的模型,在 4 张高带宽显存的 NVIDIA H200 平台上进行 non-CFG 全参数 Qwen-Image OCR 对齐训练时,该系统能够跑出每 GPU 每秒 0.510 张图像的吞吐水平,折算下来单步训练大概仅需 250 秒。这种极高的数据通量,让多模态 RL 从“象牙塔里的理论玩具”真正走向了“工业界可调优的实用工具”。从实际生成的表现来看,效果更是立竿见影:
在仅仅经历 120 步的微调迭代后,模型生成的文字边缘清晰度与结构准确性有了肉眼可见的质变。

整个训练过程的评估监测曲线表明,它的收敛控制能力非常出色,无论基于特定指标的 Critic Reward 还是全局验证集上的 Validation Reward,都在迭代过程中保持了平滑上升趋势。关于这套完整度极高的指标检测方法,技术团队在官方文档中还特意增设了专门的度量说明页面,指引不同多模态任务下的指标对齐。
未来演进:多模态RL的下一块拼图
目前,该框架已经做到了异步奖励评估,但真正的野心是让 Actor 策略更新、Rollout 模拟生成和 Reward 裁判打分这三大核心组件,实现彻底的流水线解耦和全异步高并发,从而将 GPU/NPU 的运行能效拉到极限。其未来的核心演进路线将聚焦于:
- 更深度的 vLLM-Omni 联合调优: Rollout 生成永远是多模态 RL 耗时最长的环节。未来将通过极致的量化手段、自适应算子融合及更细粒度的 batching 策略持续加速多模态 rollout 效率。
- 高效的全模态 Trainer: 除了目前的 DiffusersFSDPTrainer,后续将推出基于 Megatron-core 和 VeOmni 的高性能 trainer 引擎,支持更大规模的分布式对齐。
- 多元生态的兼容与打磨: 强化 Ascend NPU 的运行性能,并通过高度可拆卸的底层硬件插件系统包容更多样化的算力后端。
伴随着 VeRL-Omni 这款开发利器的破局,多模态与扩散模型也终于摆脱了粗暴“SFT”后就草草收尾的尴尬,正式迈入了精细化、“千人千面”构建自我强化闭环的新纪元。在这场由大模型向物理世界全模态跨越的长跑中,一个稳固、高效的基础底座已经为我们铺就。