99%工作交给AI,人类仅花2小时:DeepSeek研究员用Agent写了篇46页的硬核论文

导语:DeepSeek研究员陈德里亲自演示:如何用一套自研Agent系统,在2小时内写完一篇46页的重磅学术综述。

写一篇含金量十足的学术论文到底需要多久?

传统方法下,搜文献、筛数据、拉框架、写代码再到反复调试 LaTeX,即便是最拼命的顶尖学者,起码也得脱掉一层皮、枯坐一整月。然而,DeepSeek 的研究员陈德里最近用切身经历给出了一个极具震撼力的答案:人类“动脑”的时间,全加起来不到2小时。

在最新公布的动态中,陈德里分享了他与自研学术 Agent“DeliAutoResearch”协同作战的惊人成果——一篇长达46页、拥有103个经严格验证的参考文献、包含7个高级图表和4个对比表格的系统性学术综述。在这项庞大的写作工程中,人类的定位几乎完成了一场革命性的置换:仅有1%是由人类执笔,其余99%全由 Agent 链条自主搞定。

回看整个生产链路的数据记录,这绝非应付差事的AI灌水,而是一场极其硬核的“极限施压”。在这项任务中,AI 智能体被赋予了高度的自主探索权,整体迭代前后历经6个版本(V1完成4次大的框架修正,V2与V3各进行1次深度优化)。在近6天的时间里,这套由 DeepSeek-V4-Pro 主导推理与写作、GPT-Image2 辅助画图的 Agent 系统,完成了约108轮深度调用,疯狂消耗了64.8万个 Token,并手敲出2234行结构严整的 LaTeX 代码。

陈德里直言,随着各类开发 Agent 在学术界的无孔不入,计算机科学领域的论文产出正在迎来一场破坏力十足的“大通胀”。过去要啃下如此大体量的文献堆叠,科研人员得把自己关在书房一个月甚至更久。如今,这颗碳基大脑在期间的“总工作时间”还没超过2个小时。人类唯一需要做的,就是扮演高阶发起者、缺陷把关人与架构终审者。

【2小时写完46页论文】DeepSeek科研Agent自动学术写作

科研Agent的自主狂飙:从“辅助输入”到“全自主学术”的五级谱系

陈德里这篇综述的核心内容,正是为当前野蛮生长但缺乏统一行业标准的 AI 科研智能体,梳理出一套明晰的自主度分级体系(L1–L5)。这套参考了 SAE 自动驾驶级别的架构,为科研界勾勒出了一条从单纯工具到独立学者的演进道路:

  • L1:基础自动补全。也就是早期 GitHub Copilot 的形态,本质上是个高级的黑盒输入预测器,站在程序员背后猜测下一行代码的逻辑,属于被动式的辅助交互。
  • L2:单步任务执行。代表作如日常使用的 ChatGPT 或 Claude 聊天机器人大模型。它们具备调用某些插件或工具的能力,能根据明确指令把任务拆解,但关键结症在于:每执行一步,都必须停下来等待人类按下确认批准。
  • L3:多步骤协同执行。当前的主流行业标杆(如 Claude Code 或 Cursor Agent)便卡在这个段位。它们可以根据一个中等复杂度的开发目标,自主推演10到100个步骤,只有在碰壁或触及关键安全阈值时,才会转头向人类求助。
  • L4:限定领域的全自主执行。这正是目前前沿科学和工程 Agent 所盘踞的边界。人类在这一阶段彻底解放了双手,只需丢入一个研究主题与具体的评估标准,智能体就能自发组织起文献检索、设计多步实验、调试代码并在最后的 LaTeX 中完成输出。虽然它们尚不能自主寻找新的学术方向,但在给定的科研跑道上已经能完成自我闭环。
  • L5:完全自导型研究终极体。这是科研智能化所追求的圣杯状态。在这种预期中,Agent 将拥有持续的知识沉淀机制与无瑕疵的评估反馈,它能独立发掘有价值的科研议题、合理规划计算资源,甚至跨越学科界限进行长达数年的知识迭代。

论文中明确指出,阻碍我们从 L4 跨越至终极 L5 的,绝非简单的底座模型推理能力不足,真正的天花板在于“持续性知识的留存与沉淀”,以及“智能系统能否进行不偏不倚的、高可靠性的价值自我评估”。当 AI 无法对自身产出的对错进行反思,它就极易退化成无用的学术复读机。

四大体系深度博弈:科研Agent的底层骨架怎么搭?

为了让限定领域的自动化学术成为可能,文中归纳了现存科研 Agent 底座的4种主流架构设计,并对其进行了多维度的生存力解剖:

【2小时写完46页论文】DeepSeek科研Agent自动学术写作

  • 单智能体迭代推理模式(Single Agent Loop):以 ReAct 和 LATS 等早期探索框架为核心,由单一模型通过观察、推理和行动完成自我驱动。它极度轻量化,成本低,但在面对多线并行、盘根错节的科学问题时,单脑容量很容易触及极限。
  • 多智能体协作网络(Multi-Agent Collaboration):类似 AutoGen 和 MetaGPT,将不同的模型装扮成教授、审稿人、程序员等不同职能角色,通过分工协作和群体对齐来纠正偏差。这种模式有着极强的纠错深度,但沟通冗余太大,经常导致对 Token 的消耗呈指数上升。
  • 分层规划与执行系统(Hierarchical Planning and Execution):宛如 Devin 与 Claude Code 的深层设计,将长时程复杂任务在顶层进行宏观分割,再逐层下派给各子模块执行。它天生适合开发周期长、需要强监督的深度研究。
  • 工具增强执行系统(Tool-Augmented Execution):代表系统如 SWE-Agent,高度依赖于底层的沙盒容器环境、浏览器、数据库和各式强大的外界 API。在这种结构下,人机交互接口(ACI)的设计质量直接决定了模型能力的上限。

【2小时写完46页论文】DeepSeek科研Agent自动学术写作

这四种架构模式并不存在绝对的优劣之分,它们在复杂的实战科研里往往会被打包成混合架构来扬长避短。在对17个主流 Agent 系统进行横向评测后,研究指出代码智能体目前成熟度最高,而面向科学发现的智能体也正在初步发掘并产出可验证的新规律。

狂奔下的隐形天花板:不可回避的六大痛点

即便有自研 DeliAutoResearch 这样能实现极速输出的利器,陈德里依旧冷峻地指出了科研 Agent 在迈向大规模普及前,行业必须正面硬刚的六个隐蔽障碍:

  • 认知循环陷阱:在长程执行中,Agent 一旦在某段逻辑上发生理解偏差,会倾向于无休止地在错误的路径上重复无效尝试,缺乏类似于人类那样的“及时止损并重构思维”的安全刹车机制。
  • 上下文瓶颈:无论当前的上下文窗口缩放到多长,要支撑一个耗时跨越数月的复杂研究课题,固定记忆窗口内的信息衰减与信息漏失依然是横贯在眼前的巨大障碍。
  • 学术原创性评估真空:AI 可以不知疲倦地把现存文献拼接、改写甚至做出完全符合逻辑的推演,但如何利用算法自动判断一篇论文是否真正具有“开创性的学术价值”,整个行业目前依旧缺乏科学指标。
  • 结果漂移与可复现性灾难:由于底层大模型固有的随机性和对提示词的极度敏感,同一个 Agent 工作流在不同时段运行可能会得到截然不同的实验数据,这对于严谨的纯学术科研来说,算是一大软肋。
  • 伦理与安全双重风险:全自动工具的普及极易降低垃圾文献的制造成本,催生海量学术灌水,甚至有加速“双用途”危险材料及有害算法失控的安全隐患。
  • 计算成本与资源不平等:每一次高自主 Agent 的深度运转,其背后的 API 消耗对普通开发者或缺乏资金的实验室而言都十分昂贵。研究指出,单次复杂任务成本攀升,极大加剧了学术科研圈的马太效应。

人机协作的终局演进:从“执笔人”到“按动电钮者”

对研究员个人的日常工作而言,这次试验不仅仅是一次技术可行性的概念验证,更深刻地帮他重新夺回了被杂务榨干的业余精力。高强度的科研开发曾让陈德里搁置了很多想法,但在科研 Agent 接盘具体写作流程之后,积压多日的奇思妙想又被高效地捡了起来,他甚至顺手调教 Agent 彻底翻修了自己的个人主页。

【2小时写完46页论文】DeepSeek科研Agent自动学术写作

在 AI 学术浪潮呼啸而来的今天,这个鲜活的案例恰恰证明了科研范式的本质转移:人类的身份正在全面朝向“Initiator(意图发起者)”和“评审人”收拢。你不再需要去死磕排版格式,不需要去繁琐地撰写每一行结构雷同的说明文字。当机械和繁琐的智力劳动被完全托管,思想本身的闪光度,终将成为划分学者含金量的唯一尺度。

© 版权声明

相关文章