1930年知识模型微调后竟能写代码?Talkie-1930-13b在SWE-bench上实现4.5%通过率
导语:1930年的知识模型微调后竟能写代码?4.5%通过率引发对智能本质的思考。
近日,一个知识截止于1930年的“古董”大模型——talkie-1930-13b,在被微调为软件工程师后,成功解决了真实的编程问题。这一成果由研究员Nick Levine、多伦多大学副教授David Duvenaud以及GPT系列之父Alec Radford参与推动,引发了关于智能本质的广泛讨论。
模型背景:一个“老古董”AI
talkie-1930-13b的独特之处在于其训练数据的严格限制:所有数据必须来自1931年1月1日之前。这意味着它不知道电视机、互联网,甚至不知道二战的结局——它的世界永远停在了1930年。然而,就是这样一个模型,在微调后竟然能处理现代Python编程问题。

微调实验:250个样本让“老头”学会修bug
团队对talkie-1930-13b进行了微调,目标是解决SWE-bench上的真实软件工程问题。令人惊讶的是,仅用250个训练样本,模型就成功落地了第一个修复——针对xarray库的一个小补丁。
整个过程耗时49轮对话,看起来颇为曲折。例如,在第12轮尝试应用补丁时失败,但模型没有放弃,经过反思和修正,最终在第44轮成功修复。这种试错、反思和自我修正的能力,与现代先进模型如出一辙。

Benchmark表现:4.5% pass@1的惊人成绩
当训练数据扩展到约75K条轨迹(约10亿token)时,模型在SWE-bench-Verified上达到了4.5%的pass@1。要知道,它原本在HumanEval上只有4%的pass@100,进步幅度显著。虽然绝对值不高,但考虑到模型的知识截止于1930年,这个结果已经非常离谱。
对照实验:互联网模型仅高出1个百分点
团队还训练了一个兄弟模型talkie-web,它在互联网数据上预训练。使用相同的微调配方,talkie-web在SWE-bench-Verified上的得分为5.5%。令人惊讶的是,尽管talkie-web拥有更丰富的现代知识,它仅比“老头”模型高出1个百分点。
开源与未来展望
项目已在GitHub开源(https://github.com/RicardoDominguez/talkie-coder),欢迎复现。团队在README中表示,他们渴望看到1930模型与互联网模型在后训练持续扩展时的完整scaling曲线对比。
结论:智能的本质是什么?
这一实验颠覆了“AI需要吃掉整个互联网才能变聪明”的传统认知。一个只读过1930年以前书籍的模型,通过正确的后训练方法,就能展现出现代推理能力。这表明:智能的瓶颈或许不在于预训练数据的多少,而在于模型是否具备基本的语言理解能力以及后续的训练方法。当我们思考智能的本质时,或许应该停下来重新审视:我们究竟需要多少数据才能真正定义智能?