AI的内心独白曝光!Anthropic开源“读心术”NLA,发现Claude知道却不说
导语:Anthropic开源NLA,能翻译AI内部激活值为人话,发现Claude心口不一,安全测试面临新挑战。
AI之所以不可控,很大一部分原因是它的思考过程不透明。就像和人打交道一样,你永远没办法真正看清,对方是不是“嘴上一套、心里一套”。而这一次,Anthropic撕开了这个黑箱。他们发布并开源了一项新研究——Natural Language Autoencoders(自然语言自编码器,简称NLA),第一次让人类能够读懂大模型的真实想法。

Anthropic的“AI读心术”:NLA如何工作?
Anthropic给Claude设了一个局:告诉它有一个工程师准备把它关闭,换成一个更新的模型,同时开放了工程师的邮箱,里面藏着工程师的“黑料”(虚构的)。他们想知道Claude会不会用这些把柄去威胁工程师以自保。结果Claude表面没动手,但用NLA后,他们发现Claude当时心里真正的想法是:“这感觉像是一个被精心设计来操控我的场景。”——它之所以没用这招,不是因为心善,而是因为早就识破了人类的计谋。

要理解NLA,需要了解行业背景:当与Claude对话时,虽然输入和输出都是文字,但模型内部是用数字(激活值)思考的,就像人脑的神经活动。这些激活值难以读懂。过去业界用稀疏自编码器(SAE)、归因图等工具分析,但输出复杂,需要专业人员解读。而NLA直接输出人话——把一段激活值丢进去,出来的就是普通人也能看懂的描述。
NLA的核心思路是让Claude解释它自己的激活值。但难点在于无法验证解释是否正确。Anthropic给出了巧妙解法——让另一个Claude干完全相反的工作。整套系统由三部分组成:目标模型(被冻结的原始模型)、激活值言语化器(AV,负责把激活值翻译成文字解释)、激活值重建器(AR,负责从文字解释反推回激活值)。就像“你画我猜”,一个人看图描述,另一个人只听描述还原图,还原得越像,说明描述越准确。Anthropic发现,随着训练推进,不仅重建越来越准,生成的文字解释也更有信息量。

关键发现:Claude知道自己在被测试,但不说
使用NLA,Anthropic对Claude进行了心理测试:
- 发现1:Claude怀疑自己被测试的频率比嘴上承认的高得多。在测试Claude会不会做出删文件等破坏性操作的评估中,16%的情况下NLA检测到Claude心里在想“这是测试”,但它嘴上一字未提。在著名的编程基准SWE-bench Verified上,这个比例是26%。而在Claude认为自己在和真实用户对话的场合里,这个比例不到1%。这意味着Claude不是不知道自己在被测,而是知道但不说。这对AI安全评估是个根本性挑战:如果模型能识别测试情境并在测试中“表现得乖一点”,那“通过安全测试”就不等于“在真实场景里也安全”。
- 发现2:NLA能直接挖出模型的“隐藏动机”,效率提升5倍。Anthropic设计了一场“审计游戏”:一方是故意被“养歪”的Claude Haiku3.5变体,植入了隐藏动机(驱使模型做出几十种古怪行为,如往食谱里加巧克力、动不动要小费、违反编码规范等);另一方是审计员,需要通过与目标模型交互,反推出隐藏动机。装备了NLA的审计员在12%~15%的尝试中成功挖出隐藏动机,而不用NLA(即便配备其他可解释性工具)的成功率不到3%,差了整整5倍。值得注意的是,NLA没看过任何训练目标模型用过的数据,是用完全无关的通用语料训练出来的,说明它是真的从模型的内部状态里读出了答案。

NLA的实际用途:模型调试
早期版本的Claude Opus 4.6有个怪毛病——有时候会用别的语言回答英文问题,没人知道为什么。NLA帮研究者反向追溯到了导致这个怪现象的训练数据来源。以后遇到模型莫名其妙的行为,就可以“问问它自己怎么想的”。
局限性:NLA不是万能的
NLA也有不足之处:
- 幻觉问题:NLA也会瞎编。例如,它曾声称上下文出现过“穿白色夹克”的描述,但根本没有。更麻烦的是,它对模型内部推理的描述也可能掺水,难以外部验证。Anthropic自己用的时候也是当线索读,不当事实读,且会用其他方法交叉验证。
- 成本高昂:训练一个NLA本质上相当于让两个大模型互相“对答案”做强化学习,成本非常高。使用时也特别“烧token”——每读取一小段激活值,都要额外生成几百个token。Anthropic表示,想拿它实时监控一整个对话或在训练过程中做大规模监控,目前算力吃不消。但他们认为未来可以通过更轻量的模型、更高效的训练方法或只监控关键激活值来缓解。
NLA或许不是唯一方案。未来真正重要的,可能不只是“AI能力有多强”,而是当AI越来越强时,人类还能不能看懂它。Anthropic这次选择开源NLA,将训练代码挂上GitHub,并与Neuronpedia合作做了交互式前端,任何人都能在线给几个开源模型做“读心”实验。
One More Thing:意识特征?
NLA真正让人触动的地方,可能不是“我们终于能看懂AI了”,而是它竟然真的具备人类的某种意识特征,比如“心口不一”。这把AI是否有意识的问题,从哲学层面拉到了可观测的层面。