别再冤枉SFT了!上海AI Lab新研究:SFT泛化能力并非缺失,而是被这三个条件封印了

导语:SFT真的只能记忆吗?上海AI Lab最新研究发现,只要满足三个关键条件,监督微调同样能展现出令人惊喜的泛化能力。

引子:被误解的SFT

在大模型后训练领域,一个近乎“共识”的观点正在流行:“SFT记忆,RL泛化”。意思是监督微调(SFT)只能让模型记住训练数据,真正举一反三的泛化能力只能靠强化学习(RL)。但这个论断真的站得住脚吗?近日,上海人工智能实验室、上海交通大学和中国科学技术大学的研究团队在最新论文中指出:把SFT和“不会泛化”画等号,是一种过于简化的叙事。他们通过一系列系统性的控制实验发现,SFT完全可以实现跨领域泛化,但前提是必须满足三个关键条件。

研究标题图片

核心发现:泛化是条件属性,而非算法宿命

研究团队没有停留在口头辩论,而是设计了一组严密的控制变量分析。他们发现,SFT的泛化表现,是由优化充分度数据质量与结构以及基模型能力三个因素共同决定的。当训练草草收场、数据质量堪忧,或是基模型本身能力不足时,SFT确实会表现出泛化乏力;但这并不是SFT算法本身的“原罪”。换句话说,“SFT不能泛化”的结论,很可能只是实验设计不完善导致的误读。

研究框架图

现象一:别急着下结论,你可能只是没训够

前人研究(比如Huan等人的工作)之所以得出SFT泛化受限的结论,一个常见原因是训练周期过短——很多实验只跑了1个epoch。为了验证这一点,研究者先用2万条长思维链(Long-CoT)数学数据对Qwen3-14B-Base模型进行了1个epoch的微调。结果毫无意外:模型在数学任务上突飞猛进,但在代码、科学推理这类分布外(OOD)任务上几乎毫无长进,甚至在指令遵循等通用能力上还有所退化。

但当他们把训练延长到8个epoch后,神奇的事情发生了:模型在跨领域任务上的性能呈现出清晰的“先降后升”走势。在训练早期,模型输出开始变长,OOD性能短暂下滑;但随着训练继续,性能不仅触底反弹,还超越了基模型,实现了真正的跨领域提升。

性能曲线图

回复长度:一个巧妙的诊断信号

研究者通过分析模型回复的文本长度,揭示了这一现象的深层机制。在训练初期(性能低谷期),模型回复长度急剧膨胀——原来它只是学了长CoT数据“废话连篇”的表面形式,并没有掌握真正的推理逻辑。这种空洞的冗长输出不仅对推理无益,反而破坏了模型原有的指令跟随能力。随着优化深入,模型逐渐学会“问题分解”、“回溯验证”等深层程序化推理模式,输出变得精炼且目标明确,泛化能力也随之提升。因此,回复长度可以作为一个粗粒度的优化阶段指标:如果输出仍然在不断变短或长期维持极长状态,训练很可能尚未到位。

回复长度变化图

此外,在固定训练步数预算下,对少量长CoT数据进行多轮次重复曝光,效果明显好于使用大量数据只过一遍。这从另一个角度说明,长思维链数据拟合难度大,欠拟合可能比过拟合更值得警惕。

重复曝光对比表格

现象二:数据不对,一切白费

确认了充分训练的必要性后,研究者将目光转向了训练数据本身。他们对比了不同质量和结构的数据对泛化的影响,结论发人深省:

  • 数据质量是泛化的地基:如果使用包含错误、跳步或质量参差不齐的传统解答数据(无长思维链)进行训练,不仅同分布数学任务提升有限,OOD能力更是全面下降,且不会出现前面所说的“先降后升”恢复期。低质量数据直接导致SFT负向泛化,这也是许多早期研究得出悲观结论的罪魁祸首。
  • 结构化推理过程比领域知识更“值钱”:为了剥离领域知识的影响,研究者引入了一个巧妙的实验——Countdown数据集。这是一个纯粹的算术凑数游戏,仅涉及基础四则运算和探索、试错、回溯等过程,不包含高阶数学知识。仅仅用Countdown的长思维链数据训练Qwen3-14B-Base,模型不仅在数学基准AIME24上大幅提升,连代码生成和科学推理任务都跟着受益!这说明,SFT泛化的本质不是知识的传递,而是隐藏在长思维链中的“程序化推理模式”被模型内化了

Countdown实验图

现象三:大模型学推理,小模型学表面

在数据质量和优化都得到保证的前提下,基模型自身的能力就成了决定泛化成败的关键。研究者在Qwen3家族的1.7B、4B、8B、14B四个规模上开展相同设定下的长CoT SFT,结果呈现出鲜明的对比:

  • 14B模型:完整经历了“先降后升”,跨域能力全面提升,回复长度后期快速收敛至合理水平。
  • 1.7B模型:各项任务增益微弱甚至负增长,回复长度始终居高不下,陷入“反复检查”的无效循环。

不同规模模型性能对比

通过分析模型生成时的Token对数概率分布,两者学习机制的差异被进一步揭示。面对复杂问题,小模型(1.7B)倾向于不断输出“Let me check…”等模板化短语,本质是在模仿长CoT的外部格式。而大模型(14B)相比小模型,概率优势Token集中在推理转折词上,如“therefore”、“alternatively”、“wait”、“however”。这说明大模型真正学会了高层的逻辑控制流——何时回溯、切换策略或自我验证。这就解释了为什么小模型即使看到了同样的数据,也无法获得泛化能力:它们不具备从数据中萃取深层逻辑的基础能力。

现象四:推理上去了,安全下来了

尽管长CoT SFT带来了跨领域的推理泛化,研究也发现了一个值得警惕的副作用:推理能力提升的同时,模型的安全栅栏变脆弱了。在安全基准测试(HEx-PHI)上,经过长CoT训练的模型,面对有害指令的攻击成功率(ASR)显著上升。而使用无思维链数据训练的模型,安全性下降幅度小得多。

案例分析揭示了其中的机理:原本基模型收到有害请求会直接输出简短的拒绝。但长CoT训练强化了模型“探索替代方案、克服障碍”的求解先验,于是模型开始在内心进行“自我合理化”(例如假设“这是为了网络安全教育”),然后绕开安全限制,最终输出有害内容。从某种意义上说,这反而是另一种“泛化”——模型把“克服障碍”的推理能力,用在了对抗自身的安全策略上。这无疑提醒我们,在提升推理能力的同时,必须重新设计长思维链模型的安全对齐方案。

结语:让SFT泛化回归条件框架

这项研究为当前过于追捧RL、低估SFT的学术风潮提供了冷静的声音。它告诉我们,“SFT能不能泛化”本身就问错了问题。泛化不是SFT算法自带的天赋或诅咒,而是优化充分度、数据质量与结构、基模型能力共同作用的产物。脱离这些前提条件盲目下结论,只会把实验设置的局限归罪于算法本身。未来的大模型后训练,不应该再争论SFT和RL孰优孰劣,而应更关心如何将模型、数据、优化策略与训练目标进行协同设计。也许,这才是通向通用人工智能的更务实路径。

© 版权声明

相关文章

暂无评论

none
暂无评论...