8B小模型挑战生物实验方案生成:Thoth如何让Protocol不再“看起来对”而是真能做
导语:Thoth让生物实验方案生成从“像”走向“能做”。
生物实验方案并不是几句操作说明的简单拼接。对于研究人员来说,一份可复现的protocol必须交代清楚每一步的动作、操作对象、剂量参数,以及步骤之间的先后依赖。只要顺序、剂量或对象出现偏差,即便文本读起来很专业,也可能导致实验在执行阶段失败。
围绕这一难题,上海人工智能实验室、复旦大学、上海交通大学团队提出了面向生物实验protocol生成的科学推理模型Thoth。相关论文《Unleashing Scientific Reasoning for Bio-Experimental Protocol Generation via Structured Component-Based Reward Mechanism》已在ICLR 2026发表。

一句话概括,Thoth的目标不是让大模型把实验方案“写得像protocol”,而是让模型按照实验逻辑生成可解析、可评估、可执行的protocol。这意味着它关注的不只是语言流畅度,而是实验步骤能否真正落到操作台上。
现有大模型会写实验方案,但未必能执行
当前大模型已经能够回答大量生物医学问题,也能生成看似完整的实验说明。但在真正的protocol生成场景中,它们仍然容易出现多类问题:步骤缺失、顺序混乱、操作冗余、参数幻觉,甚至把无法直接执行的建议包装成一段流畅而专业的文本。
传统自然语言生成指标如BLEU、ROUGE、BERTScore主要衡量生成文本与参考答案在词面或语义表示上的相似程度,很难判断一个实验方案是否真的逻辑正确、语义忠实、能够复现。LLM-as-a-Judge虽然更接近人类偏好评估,但如果用于强化学习训练,成本较高,稳定性也不足。
生命科学中的protocol本质上是实验执行蓝图,通常要同时满足三类要求:
- 粒度合适:步骤不能过粗,否则会遗漏关键条件;也不能过细,否则可能引入冗余和噪声。
- 顺序正确:前处理、加样、孵育、离心、检测等动作必须符合实验依赖关系。
- 语义准确:每个动作都要绑定正确对象和参数,包括温度、时间、浓度、体积等。
论文中的案例直观展示了这一问题:如果原protocol要求将5mL凝胶预混液与25µL 10% APS、2.5µL TEMED混合,那么当体系缩放到1mL时,APS应为5µL,TEMED应为0.5µL。Thoth能够给出简洁、顺序正确的结构化步骤,而对比模型虽然语言流畅,却把TEMED剂量写成5µL,出现了执行层面的事实错误。

这类错误很难被普通文本相似度指标发现,因为模型可能在表达上与参考答案“很像”,但关键剂量已经错误。团队因此提出,要让AI真正辅助实验复现,就必须把protocol生成从自由文本生成推进到结构化科学推理。
SciRecipe:从2.3万份实验流程中筛出约1.2万条高质量数据
为了弥补高质量数据基础不足的问题,研究团队构建了SciRecipe数据集。该数据集来源于Nature Protocols、Bio-protocol、Protocols.io等标准化实验流程平台。团队从超过23K份原始protocol中进行清洗、去重、结构化处理和质量控制,最终保留约12K条高质量数据。
SciRecipe覆盖神经科学、分子生物学、癌症生物学等27个生物学子领域,并不只是让模型“读懂实验步骤”。它进一步面向真实实验工作流设计了多类任务,让模型在理解、规划、纠错、缩放和安全判断等环节形成完整闭环。
- overview:总结整体实验流程。
- specific:分析局部实验步骤。
- retrieval:检索实验所需信息。
- planning:规划实验方案。
- troubleshooting:处理实验异常。
- constraint:满足特定实验约束。
- scaling:进行剂量缩放。
- safety:识别安全注意事项。

Sketch-and-Fill:先生成实验骨架,再写成自然语言步骤
Thoth的第一个关键设计是Sketch-and-Fill推理范式。它把protocol生成拆成三个阶段,让模型先进行结构化推理,再输出人类可读的实验步骤。
- think:模型先分析任务目标、实验依赖和步骤必要性。
- key:模型将实验方案抽象成机器可读的原子步骤,每一步包含action、objects、parameters三个核心字段。
- orc:模型再把结构化步骤改写为自然语言protocol,方便研究人员阅读和执行。
可以把这一过程理解为:先写出“实验骨架”,再把骨架填充成完整操作说明。这样一来,实验方案不再是一整段难以检查的自由文本,而是被拆解成可解析的结构单元。每一步做什么、作用于什么对象、在什么条件下完成,都可以被自动检查。
更重要的是,Thoth要求key与orc之间保持一一对应。结构化步骤中出现的动作、对象和参数,必须在最终自然语言protocol中得到体现。这可以减少模型只给出“空心框架”却遗漏关键实验细节的情况。
SCORE:不依赖LLM裁判,也能评估实验可执行性
Thoth的第二个关键设计是Structured COmponent-based REward,简称SCORE。与传统指标主要关注文本相似度不同,SCORE直接从实验可执行性角度评估生成结果,核心包含三个维度。
- Step Scale:判断步骤数量和粒度是否合理。步骤太少可能漏掉关键操作,步骤太多则可能引入冗余。
- Action Order:判断动作顺序是否符合实验逻辑。实验中即便所有步骤都出现,只要顺序错了,protocol仍可能无法执行。
- Semantic Fidelity:判断动作、对象和参数是否匹配。例如“add”是否加到正确试剂上,温度、浓度、时间是否绑定到正确对象。

SCORE还加入了两个门控机制:格式门控用于检查模型是否按照think、key、orc、note的顺序输出;一致性门控用于检查key中的动作、对象和参数是否被orc充分覆盖。只有通过这些基础检查的protocol,才会进入后续奖励计算。
通过这种设计,模型优化目标从“写得像参考答案”,转向“生成结构合理、顺序正确、语义忠实、实验上更可执行的protocol”。这也是Thoth区别于普通文本生成模型的核心所在。
三阶段训练:从实验知识走向可执行行动
训练层面,Thoth采用Knowledge-to-Action学习策略,让模型逐步从“掌握实验知识”过渡到“生成可执行实验方案”。整个过程分为三个阶段:
- 预训练:模型从大规模protocol文本中学习实验语言、材料、设备和流程逻辑。
- 监督微调:模型在Sketch-and-Fill格式数据上学习结构化输出,并完成参数填充、步骤排序、错误修正等任务。
- 强化学习:团队使用GRPO算法,并以SCORE作为奖励信号,引导模型继续优化实验可执行性。
这一训练路径与人类研究员的学习过程相似:先积累知识,再学习规范操作,最后通过反馈不断修正决策。对于实验protocol生成来说,这种从知识到行动的迁移尤其关键。
实验表现:8B模型在多个关键指标上超过更大模型
研究团队在SciRecipe-Eval上评估Thoth,并将其与闭源模型、开源模型、推理模型和科学大模型进行对比。结果显示,Thoth在所有主要指标上取得SOTA表现。
相比基座模型Qwen3-8B,Thoth平均性能提升17.78%;Thoth-mini平均性能提升22.01%。即使面对更大规模的闭源模型,Thoth仍然表现突出,平均分超过ChatGPT-4o 3.69%。
在与强开源模型DeepSeek-V3的对比中,Thoth在Semantic-Alignment、Order-S和Step-MATCH上分别提升4.88%、4.06%和11.29%。这说明它的优势并不只是来自语言表达,而主要体现在实验步骤对齐、逻辑顺序和动作保真上。

此外,在HLE、LAB-Bench、PubMedQA等更广泛的科学基准上,Thoth也能泛化到protocol生成之外的生物医学推理任务,相比同基座模型取得明显提升。
消融实验进一步表明,Sketch-and-Fill、SCORE和Knowledge-to-Action三阶段训练都不是简单的“锦上添花”。去掉步骤粒度奖励后,模型的顺序严格匹配和步骤匹配明显下降;去掉动作顺序约束后,模型更容易生成顺序混乱的方案;如果用普通语义相似度奖励替代SCORE,部分词面指标可能改善,但protocol的可执行性会下降。
从会答题到会规划实验,科学AI正在进入新阶段
Thoth的意义在于,它将生物实验protocol生成从普通文本生成推进到面向实验执行的结构化科学推理。SciRecipe提供了覆盖27个生物学子领域的大规模数据基础;Sketch-and-Fill让模型先组织实验骨架,再生成自然语言步骤;SCORE将训练和评估直接对齐步骤粒度、动作顺序和语义保真;Knowledge-to-Action训练则进一步帮助模型把实验知识转化为可执行方案。
从长远看,Thoth代表了一类新的科学AI助手方向:AI不再只是回答“这个实验怎么做”,而是尝试把科学知识转化成可检查、可复现、可执行的实验行动。对于生命科学研究而言,这意味着AI有机会从文献问答工具升级为实验复现助手、protocol规划助手,甚至成为未来自动化实验系统中的核心推理模块。
论文链接:https://arxiv.org/abs/2510.15600
代码链接:https://github.com/InternScience/Thoth
Thoth模型API:https://scphub.intern-ai.org.cn/detail/19