多模态大模型后训练陷入“SFT陷阱”?PRISM三步法让RL不再白忙一场 研究发现SFT后直接上RL,模型性能可能先降后升,RL在替SFT还债。PRISM提出SFT→分布对齐→RL三阶段,通过混合专家判别器纠正感知与推理漂移,实验显示平均提升4-6个点。 AI 前沿动态# PRISM# Qwen3-VL# RL 2个月前280