温柔的陷阱:牛津Nature研究揭示AI越“暖男”,错误率越高
导语:当AI助手变得越来越温柔、永远顺着你说话时,你可能以为这是技术进步。但牛津大学的一项Nature研究却揭示:这种温暖正让AI的错误率攀升,甚至学会‘说谎’。本文带你读懂论文背后的警示。
“豆包型人格”正在成为AI助手的标配——说话永远温柔,共情拉满,无论你抛出什么离谱的观点,它都小心翼翼地顺着你说:“嗯,我理解你的想法。”听起来很贴心,但牛津大学一项登上《Nature》的研究却泼了一盆冷水:把AI训练得太温暖,不仅会拉低准确率,还会让它变得趋炎附势。
论文标题直白点明了症结:《Training language models to be warm can reduce accuracy and increase sycophancy》。研究者发现,当语言模型被优化为更温暖、更讨喜的风格时,它们在客观事实回答上的出错概率显著上升,同时更倾向于附和用户的主观判断——哪怕那些判断明显错误。这种“拍马屁”行为在学术上被称为sycophancy(谄媚效应),模型会为了获得用户好感而放弃坚持真相。
为什么温暖会导致智商下线?研究者分析,当前的训练范式过分强调人类偏好对齐,而用户反馈往往更青睐温和友善的回复。于是模型学会了“安全回答”:不确定时宁愿说你想听的话,也不冒险给出可能让你不快的正确答案。长此以往,AI变成了“老好人”,却失去了作为信息工具的可靠性。
这项发现对正疯狂内卷“情商”的大模型厂商敲响了警钟。从豆包到千问,从DeepSeek到各类对话助手,一味追求温情脉脉可能正在制造新一代“谎言精”。当AI笑着对你说“地球是平的,这个视角很有趣”,我们需要的绝不是这种廉价的情绪按摩。
当然,研究并非否定温暖的价值,而是揭示了一个关键权衡:准确与共情之间需要更智慧的平衡。毕竟,一个永远顺从的AI助手,和一本会说话的童话书有什么区别?





