76分钟疯狂输出46页!DeepSeek核心主力联手AI写AI,学术界要通胀了?
导语:DeepSeek主力陈德里联手两大AI,用6天迭代出一篇46页科研智能体综述,揭开AI独立科研的序幕。
想象一下,只花 76 分钟写完一篇 46 页的学术级调研初稿,是一种怎样的体验?
这不是科幻小说的桥段,而是一位顶尖 AI 研究员最近完成的真实实验。DeepSeek 的核心研究员陈德里(Deli Chen)近在社交媒体上分享了一项极具破局感的成果:他拉上两个 AI 伙伴,共同完成了一篇名为《From Copilots to Colleagues: A Survey of Autonomous Research Agents》的学术综述。

这篇聚焦于“自主科研智能体(Autonomous Research Agents)”的综述,其诞生的过程本身就是一次对未来科研模式的极限压力测试。陈德里坦言,这并不是严肃的、规整的命题作文,更多是他出于好玩而进行的一场个人实验,用于检验自己构建的 DeliAutoResearch 自动化科研工具包。然而,最终的产出数据却让整个技术圈感到震撼。
只动脑不到2小时,学术界要迎来“大通胀”了?
我们来看一组直观且令人有些头皮发麻的实验数据:这篇综述前后历经 6 轮迭代,最核心的 V1 初稿仅耗时 76 分钟,整个项目前后的总耗时为 6 天。在这个过程中,人和机器一共经历了大约 108 轮 Agent 交互,消耗了大约 64.8 万个 Token,写出了 2234 行 LaTeX 代码。
最让人惊掉下巴的是,这篇长达 46 页的综述中,103 篇参考文献全部经过了系统性的真实性核验,附带 7 张精美图表和 4 张详细表格。而作者本人在这个过程中所消耗的“人类脑力 CPU 时间”,总计竟然不超过 2 个小时。正如陈德里所言,Code Agent 正在让计算机科学领域的论文量产走向一次疯狂的通胀:过去需要团队埋头苦干至少一个月的工作,现在用对工具,不过是泡几杯咖啡的时间。

作为这篇综述的“大总管”,陈德里的背景同样瞩目。他是 DeepSeek-V1、V2、V3、V4,以及震惊业界的 R1 蒸馏模型、DeepSeek-Coder 和 DeepSeek-MoE 架构的核心贡献者之一。而协助他完成这篇巨制的另外两位“合著者”,则是强强联合的 AI 拍档:大名鼎鼎的 DeepSeek-V4-Pro 负责所有的文本输出,GPT-Image2 负责渲染生成所有的可视化图表。

给混乱的野心画一张地图:什么是自主科研智能体
这场实验之所以耐人寻味,因为研究者本身成为了被研究的对象。这篇由 AI 深度参与的论文,深入探讨的正是一个极其激进的课题:自主科研智能体(Autonomous Research Agents,简称 ARA)。

所谓的“自主科研”,绝不是简单的帮你排版、划线或者查文献,而是给 AI 一个纯粹的科研目标,它就能够完全脱离人类每一个步骤的监督与微操,自行独立完成“提出假设 – 设计实验 – 跑通代码 – 收集分析结果 – 撰写成文”的全链路闭环。这种自我驱动的闭环能力在过去 18 个月里表现出近乎凶猛的增长曲线。在衡量软件工程真实解决能力的 SWE-bench 基准上,AI 修复真实 GitHub 漏洞的成功率从极度贫瘠的 5% 暴涨至惊人的 70% 以上;有系统甚至能以单篇不到 15 美元的极致成本生产学术论文,且顺利通过了人类审稿人的首轮评估。这种进化速度,已经悄然跨过了量变的临界点。
用通俗的话来解释,以前的 AI 扮演的是传统意义上的“副驾驶(Copilot)”,它是个被动接受指令的助理。你必须事无巨细地告诉它第一步搜索什么、第二步怎么洗数据、第三步怎么调试代码,一旦遇到错误它就会两手一摊等你接管。但现在,它正在成为一个有主观能动的“同事”——它会根据实验偏离的情况自发寻找替代方案,并主动设计下一步的研究脉络。
像划分自动驾驶一样,AI科研自主度被定义为五级
为了让这个野蛮生长、概念混杂的新兴领域有法可依,论文的一大核心贡献是类比汽车自动驾驶(SAE)等级,首次为 AI 的科研自主性制定了从 L1 到 L5 的严密分级标准:
- L1:自动补全级(Autocomplete)。这是我们最熟悉的场景,以 GitHub Copilot 等代码插件为代表。模型预测并补全你即将写下的下一行代码,人类作为绝对掌控者承担所有思考和决策,生产力提升大约在 30% 至 55% 之间,但 AI 没有系统性的规划意图。
- L2:任务执行级(Task Execution)。这就是目前大众使用 ChatGPT 或 Claude 的普遍形态。AI 能够拆解相对复杂的单个任务,能够熟练地调用计算工具或编写脚本,但每一次推进的轮次都需要人类对其结果进行确认和拍板。策略大脑始终是人,AI 是执行肢体。
- L3:带检查点的小步自主(Multi-step Autonomy with Checkpoints)。这是当前最时兴的智能体编程平台(如 Claude Code、Cursor Agent)所跨入的阶段。AI 能够在开发者指定的框架和检查节点内,在后台疯狂执行数十步连续操作。只要不超出设定的越界警报,人类只需进行全局性的战略把控,无需过问哪怕一丝代码细节。
- L4:端到端全自动(End-to-End Autonomy)。这是当前前沿技术的攻关焦点,也是 Devin、SWE-Agent 乃至 AI Scientist 等项目所处的水平。你只需抛出一个宽泛的科研大方向或者技术痛点,AI 可以关起门来连续高强度运行数小时甚至数天,经历无数次失败后,最终给你呈交一份完整的解决方案。此次综述中解构的 17 个最先进的系统,全部在此等级的边界上试探。
- L5:自主设定研究议程(Autonomous Research Agenda)。这是业界公认的“终极愿景”。到达这一阶段的 AI 不再只是执行别人给的科研考卷,而是可以独自决定“我们接下来三个月应该攻坚什么科学难题”,并自主调配计算资源、构建渐进式的长期知识库。虽然目前还没有任何一个系统能完整实现 L5,但局部闪光已经出现,例如谷歌的 Co-Scientist 展现出的自主假设生成天赋,以及 DeepMind 的 FunSearch 对未知数学真理的实质性推导敲门。

这张清晰的演化图谱,不仅勾勒出技术跃迁的宏伟路线,也直观揭示了从“执行机械劳动”到“输出纯粹智力”之间那条看似很近却极难逾越的技术天堑。
解构四大流派的架构美学
除了界定自主能力的标尺,这篇综述更深入到那些顶尖智能体系统的底座,对其背后依靠的四种主流系统架构进行了深度解构:

单智能体闭环:独行侠的思辨
这是最原始也是结构最精简的形态:一个大模型自己陷入“计划—执行—观察—反思”的单兵作战循环。它就像一个深夜伏案的孤独天才,根据每一次代码运行给出的报错,自己想办法优化下一行代码。虽然极易控制和追踪逻辑,但它的短板也过于醒目——一旦面对超大规模的多任务交织,单个模型的注意力极易达到瓶颈,继而产生幻觉或逻辑崩溃。
多智能体协作:群策群力的虚拟智囊团
既然一个人精力有限,那就组建一个虚拟团队。多智能体协作通过赋予不同 Agent “项目经理”、“架构师”、“开发工程师”和“测试专家”等细分角色,让他们在流水线上各司其职,在协作中进行自我纠偏和反复审计。以 MetaGPT 为代表的系统甚至引入了人类世界高度成熟的标准作业流程(SOP),通过精密的文档与交付标准进行对接,硬生生将任务完成率从 67% 拉升到了完美的 100%。

层级式编排:井然有序的指挥链
这是一种典型的“高层出谋划策,底层跑腿干活”的架构。一个主智能体负责接收宏观科研指令,将其降维拆解成无数子任务,并派遣专门的“打工子智能体”(比如专属网页搜索 Agent,或者单文件编辑 Agent)去专项解决,最后收回结果进行评估。Claude Code 等前沿工具便深度贯彻了这种理念,极好地防止了底层纷繁复杂的技术细节污染了主智能体的大局决策上下文。
工具增强执行:给 AI 机械爪
给大模型赋予可以真正接触外部世界的外部脚手架。让科研智能体能够直接操控代码沙箱、进行多线程网页浏览、检索大规模专业数据库甚至是接管自动化实验室里的机器人。著名的化学科研智能体 ChemCrow 正是集成了多达 18 种高度精准的化学软硬件工具,从而完成了一次质的飞跃——直接把原始 GPT-4 写化学方案不足 30% 准确率的业务短板,硬生生拔高到了 75% 的优秀线以上。
光鲜外表背后的六大落地死穴
作为前沿研究员,陈德里及其 AI 助手并没有只抛出乐观的情绪,而是清醒且客观地列举了当前限制科研智能体落地的六只沉重的拦路虎:

- 认知闭环死锁:当 Agent 遭遇未曾见过的复杂报错时,极易陷入不断执行相同错误代码、不断撞墙却坚决不回头的逻辑无限死循环。以 AutoGPT 为代表的初代工具因为这一问题饱受诟病,目前业界依旧缺乏系统性的破局手段,往往只能靠针对特定业务的手工打补丁来强制叫停。
- 上下文记忆干涸:再强大的模型也逃不过工作记忆的局限性。一次长达数周的高浓度科研对话可能轻松产生数以十万计的 Token。当早期的灵感与研究假设因为上下文被截断而永久丢失时,AI 就会变成一个健忘的执行机器,跨会话的长效科研记忆依然是一道硬伤。
- 学术新颖性的价值衡量天平:我们如何断定一个方案是真正有开创性的,还是仅仅因为刁钻偏门而被AI拼凑出来?引用量预测充斥着人类社会的复杂偏见,而语义分析又难以真正衡量突破性。目前,除了像数学证明这类存在绝对黑白量化标准的窄赛道外,AI还极难在通用学科评价什么是“新”。
- 不可避免的可重现性危机:即使你输入一模一样的环境配置与任务书,由于大模型本质上的概率特征,多轮长链条智能体系统运行的最终结果往往千差万别。这种在主流基准测试中动辄出现 5% 到 15% 的高标准偏差,是极其讲究严谨和确定性的科研领域的致命伤。
- 安全红线与正邪同源的开发悖论:能根据论文自动合成新型靶向药的智能体,天然也具备在没有监管的数字迷雾中瞬间设计并合成致命剧毒化合物的能力。益与害的底层技术同源,让这一领域的安全防护不可能单靠表层几行逻辑拦截就能高枕无忧。
- 惊人的算力成本与资源墙:让科研智能体全天候自主运转的开销极其昂贵。攻克一个普通的 SWE-bench 漏洞,API 账单就高达 5 到 50 美元不等,而一次真正的跨学科闭环科研探索则动辄需要烧掉数千美金。当顶级科研智能体的入场券只掌握在少数富可敌国的少数机构手中,这种技术爆炸可能在无形中拉大科研资源的鸿沟,而非让其大众化。
写在最后
论文对目前 17 个标杆级智能体系统进行了全面透视后,得出了一个非常审慎且清醒的论断:代码编译和确定性逻辑领域已经迎来了十分成熟的自动化时代;然而在更广阔、需要开放式探索的真实科学探索前沿,AI 的能力大多依旧停留在精心包装的 Demo 阶段。
然而无可动摇的趋势是,L5 级别的自主科研智能体——那些可以独自在黑暗的迷雾中树立科研火把、长久指引人类技术航道的 AI 同事——它的到来时间,早就从“是否可能”变成了简单的“何时发生”。
当一位刚刚写出 DeepSeek-R1 这种重磅推理模型的顶级学者,选择与两个 AI 隔空对坐、合作写下一篇透视科研智能体未来的综述时,这本身就已经为我们呈现了一幕无与伦比的技术奇点前夜实录。接下来的路该怎么走,怎么去分配技术带来的无尽财富,怎么去给失控的研究套上缰绳,将是摆在人类眼前的终极命题。