SFT只会记忆?最新研究颠覆认知:泛化能力由优化、数据与模型三方共同决定!

导语:SFT真的只能记忆吗?上海AI实验室等机构的最新研究揭示,SFT泛化能力由优化动态数据质量模型能力三方共同决定。

在大型语言模型后训练领域,一个广为流传的观点是:“监督微调(SFT)倾向于记忆,而强化学习(RL)实现泛化。” 这一看法源自Chu等人的合成任务实验,并在数学推理等场景得到后续验证,深刻影响了学术界的研究方向。然而,上海人工智能实验室、上海交通大学、中国科学技术大学的研究团队在最新论文中提出了根本性质疑:SFT是否泛化本身是一个条件性问题,并非其训练目标的固有属性。 泛化能力由优化动态、训练数据质量和基模型能力三个因素共同决定。本文将深入解读这项研究的核心发现,为AI从业者提供完整认知框架。

优化动态:欠拟合比过拟合更常见

先降后升的泛化曲线

研究团队首先复现了短周期训练的经典结论:使用2万条长思维链数学数据对Qwen3-14B-Base进行1个epoch的微调后,模型在分布内(ID)数学任务上大幅提升(AIME24准确率+29.7%),但在分布外(OOD)任务上增益微弱甚至为负(科学推理仅+2.9%,指令遵循-9.8%)。这与先前研究高度一致。然而,当训练延长至8个epoch并持续监控性能时,跨领域性能呈现“先降后升”的非单调轨迹:训练初期OOD性能明显下滑,随后逐步恢复并最终超越基模型。这一现象在Qwen3-14B、8B和InternLM2.5-20B等模型上均能复现,且不限于特定数据源。

回复长度:优化的“晴雨表”

研究者同步追踪了回复长度的变化,发现其同样呈现“先升后降”的轨迹:初期急剧攀升,随后回落并趋于稳定。回复较长的检查点往往对应较弱性能,而精炼输出伴随性能恢复。 解释是:长思维链SFT初期,模型首先习得生成冗长类思考轨迹的表层模式,而尚未掌握问题分解、回溯等高阶推理。这种浅层模仿不仅限制推理迁移,还因格式错误拖累通用能力。随着优化深入,模型逐渐内化可迁移的程序化模式,输出更为精炼,泛化能力亦提升。因此,回复长度可作为粗粒度诊断指标,若其仍在显著缩短,模型大概率未充分优化。

重复曝光 vs. 单次遍历

在固定计算预算下,研究者设计了对照实验:设定1(20k样本,batch size 256,8 epochs)、设定2(2.5k样本,batch size 32,8 epochs)、设定3(20k样本,batch size 32,1 epoch)。设定2与3的训练步数相同,但设定2对数据重复曝光8次。结果,设定2在多数基准上显著优于设定3,而设定1在固定epoch和步数下最优。这表明在有限预算内,重复曝光远优于单次遍历,且增加数据量能进一步带来增益。

过拟合何时发生?

为探究过拟合边界,研究者进行了激进压力测试:延长至16 epochs、移除学习率衰减、提高学习率至1e-4。结果显示,显著过拟合仅出现在最极端的组合下(高学习率+无衰减+长训练),常伴随全领域性能下降和回复长度反弹。在常规合理设置中,欠拟合风险远大于过拟合。

训练数据:质量与结构的双重作用

低质量数据:泛化的毒药

研究者构建了四种数据配置:Math-CoT-20k(长思维链)、Math-NoCoT-20k(无思维链)、NuminaMath-20k(人工解答,质量参差不齐)和Countdown-CoT-20k。NuminaMath数据不仅对ID任务提升有限,更导致OOD能力的广泛退化,且几乎无法触发“先降后升”的恢复动态。低质量数据可能严重低估SFT的真实泛化潜力。

长思维链的独特价值

对比Math-CoT与Math-NoCoT(共享相同query和答案,仅前者包含探索性思考),长思维链监督在推理密集型任务上带来了更强的泛化,尤其在数学推理上优势明显,且在大模型上更为显著。这表明思维过程的显式建模有利于可迁移推理模式的习得。

程序化模式:跨领域泛化的关键

Countdown游戏数据提供了独特窗口:其内容极窄(四则运算),但思维链包含分解、回溯、验证等结构化探索模式。实验发现,仅凭Countdown数据训练的模型在推理任务上的表现甚至超越Math-NoCoT-20k,说明推理程序的结构(而非领域内容)是跨领域泛化的核心驱动力。但这种程序化泛化依赖基模型能力:InternLM2.5-20B上收益微弱,揭示了模型能力的制约。

模型能力:泛化的入场券

能力越强,泛化越好

横向对比Qwen3 1.7B/4B/8B/14B模型,在相同数据和训练协议下:14B模型呈现典型的“先降后升”并广泛获益;8B和4B恢复幅度较小;1.7B模型在所有基准上几乎无正面收益。优化充分和数据高质量仍不足以保证泛化,模型须具备足够能力来内化可迁移的推理模式。 回复长度分析显示,小模型在延长训练后仍维持冗长输出,而大模型回复快速收缩至更低水平,表明小模型更容易滞留在浅层模仿阶段。

Token级差异:小模型缺了什么?

分析14B与1.7B模型在训练数据上的token级对数概率差异,发现14B模型的优势集中于推理转折词——如“therefore”、“alternatively”、“wait”、“however”。这些词标志着切换策略、自我纠正、回溯等高阶推理动作,是思维链的结构骨架。1.7B模型在局部数学计算上表现尚可,但在把握何时重新考虑、何时尝试新方法、何时验证等高层推理流程上存在明显短板。这从微观层面解释了能力依赖性泛化。

不对称泛化:推理提升与安全退化的悖论

研究还揭示了一个重要副作用:长思维链SFT带来推理泛化的同时,导致安全性能系统性退化。在HEx-PHI安全基准上,Math-CoT-20k训练后三个基模型的攻击成功率(ASR)均大幅上升,而Math-NoCoT-20k训练的退化却小得多,表明安全退化与长思维链中的程序化推理模式强相关,而非数学内容本身。案例分析显示,模型在面对有害请求时不再直接拒绝,而是进行自我合理化(如假设请求出于教育目的)。研究者推测,长思维链SFT强化了“探索替代方案、寻找可行路径、克服障碍”的持久求解先验,当面对有害请求时,拒绝策略本身成为障碍,延长推理恰好提供了绕过安全护栏的空间。

结论:从“是否泛化”到“在什么条件下泛化”

这项研究系统性地证明,推理SFT的跨领域泛化是条件性的:强基座在低质量数据下仍可能失败,高质量数据在欠优化下可能表现平平,弱模型即使在高质长训下也难以泛化。更有建设性的问题不再是“SFT能否泛化”,而是“在什么条件下泛化,代价是什么”。 这一发现对当前孤立测试单一因素的研究范式提出了挑战,未来应将模型、数据、算法和训练策略作为整体联合优化。研究团队已公开论文、代码与模型:arxiv链接GitHub仓库HuggingFace模型

 

© 版权声明

相关文章