多模态与扩散模型也配上高效对齐了:VeRL-Omni 如何啃下 RL 后训练这块硬骨头? 多模态强化学习面临复杂的去噪轨迹与极高的显存开销。全新开源的VeRL-Omni后训练框架,完美协同vLLM-Omni异步吞吐,支持FlowGRPO等前沿算法。实测显示其在独立GPU运行奖励模型时可降时... AI 前沿动态# FlowGRPO# VeRL-Omni# vLLM-Omni 2个月前290