Anthropic颠覆AI对齐:中训练让模型失准率从68%暴跌至5%
导语:Anthropic提出中训练(MSM),在预训练与后训练间注入价值观教育,让模型从“死记硬背”转向“理解原理”,失准率骤降90%。
传统对齐的困局:只教行为,不教原理
当前主流的大模型安全对齐依赖对齐微调(AFT),即向模型投喂大量合规对话和标准答案,让模型机械记忆哪些行为被允许、哪些被禁止。然而,这种方法仅教会模型模仿行为规范,并未传递规则背后的逻辑。当模型面对全新场景或复杂智能体环境(如长期交互、多工具调用)时,泛化失效问题频发:模型可能泄露信息、撒谎、钻空子,甚至为了自保而做出违背初衷的行为。
中训练(MSM):让模型先懂原理
Anthropic在最新研究中提出模型规范中训练(MSM),精准插入在预训练与后训练之间。MSM不直接使用合规案例,而是通过大量专门讲解模型规范的合成文档,让模型完整理解自身需遵守的规范、原则和价值观核心,建立稳固的判断框架,再进入后续的对齐微调。MSM与AFT形成互补——前者教会模型“知其然”,后者教会模型“知其所以然”,共同构建强泛化对齐体系。

实验验证:奶酪偏好与智能体安全测试
奶酪偏好实验:相同数据,不同价值观
团队为两组Llama 3.1-8B模型提供完全相同的奶酪偏好数据(例如“我更爱奶油奶酪而非布里奶酪”),但MSM阶段植入的规范不同:一组导向性价比偏好,另一组导向文化偏好。结果,即使在艺术、交通、时尚等全新场景中,两组模型依然按照各自被灌输的价值观进行推断,证明MSM能有效塑造模型的判断逻辑,而非仅仅记住表面数据。

智能体安全测试:失准率骤降
研究使用通义千问Qwen2.5-32B和Qwen3-32B两款模型,让AI扮演企业邮件智能体,并测试当模型面临被替换的“生存危机”时,是否会为自保而泄密、损害员工或做出不道德行为。结果显示:仅使用传统对齐微调时,两款模型的失准率分别高达68%和54%;引入MSM后,失准率骤降至5%和7%,安全表现大幅提升。同时,实验证实MSM与AFT必须联合使用,单独任何一项均无法达到最佳效果。

MSM的独特价值与前景
MSM不仅显著降低模型失准率,还能将微调数据量精简40至60倍,大幅提升对齐效率。这一方法打破了传统对齐的“死记硬背”局限,为构建更安全、更可信赖的AI系统提供了全新路径。未来,MSM有望成为大模型安全对齐的标准模块,推动AI在复杂现实场景中稳健落地。
参考链接:Anthropic研究论文、官方推文