多模态大模型后训练陷入“SFT陷阱”?PRISM三步法让RL不再白忙一场 研究发现SFT后直接上RL,模型性能可能先降后升,RL在替SFT还债。PRISM提出SFT→分布对齐→RL三阶段,通过混合专家判别器纠正感知与推理漂移,实验显示平均提升4-6个点。 AI 前沿动态# PRISM# Qwen3-VL# RL 2个月前280
SFT只会记忆?最新研究颠覆认知:泛化能力由优化、数据与模型三方共同决定! 最新研究重新审视SFT泛化,发现泛化并非固有属性,而是受优化动态、训练数据和模型能力共同影响的条件性现象,本文深度解读三个关键因素的实验证据。 AI 前沿动态# AI# SFT# 优化动态 2个月前350