Codex这套“自我蒸馏”提示词火了:让AI自己找出你最该自动化的重复劳动

导语:OpenAI员工分享Codex新玩法:让AI从历史工作中提炼可复用流程。

OpenAI Codex团队成员Vaibhav Srivastav在X上放出了一段很短的提示词,效果却相当抓人:把它粘进Codex,Codex会回看你的历史会话,找出你最近反复手动处理的任务,再判断哪些该做成可复用的Skill,哪些适合交给Custom Subagent,甚至哪些应该直接自动化。

这类玩法被不少开发者称作Codex的“自我蒸馏”:不是让人提前设计流程,而是让AI从你已经发生过的工作痕迹里提炼模式,再把模式固化成工具。OpenAI总裁Greg Brockman也转发点赞,并顺手转发了一条信息:Codex是开源的。这让这套用法的传播速度更快了。

一段提示词,让Codex反过来审计你的工作习惯

Vaibhav最早给出的版本很短,核心意思是:查看我最近的会话,找出重复工作流或重复请求;如果某件事属于可复用流程,就创建Skill;如果是边界清晰的角色型任务或调查任务,就创建Custom Subagent;重点关注CI失败、PR审查、changelog、文档更新、发版准备、调试、测试分诊等实际工作;只创建真正有用的内容,保持简洁。

这段提示词之所以容易火,并不是因为它写得多神秘,而是它抓住了AI编码工具当前最实际的痛点:很多人每天都在让模型重复处理同一类问题,却没有把这些交互沉淀成工具。比如每次CI失败都让Codex看日志、定位失败点、给修复建议;每次合并前都让它检查PR风险;每次发版前都让它整理变更记录。人会习惯性地“再问一次”,但AI其实可以把这套流程打包。

第一版更像程序员专用模板。CI、PR、changelog这些词,对日常写代码的人很自然,但对内容、运营、产品、研究岗位并不友好。评论区很快有人反馈,Vaibhav当天就迭代出了第二版,范围明显扩大。

第二版升级:从代码工作流扩展到几乎所有知识工作

新版提示词把回顾范围拉到了过去30天,并要求Codex按优先级读取多种数据源:最近的Codex会话和任务摘要、Codex Memories与汇总记录、Chronicle记录到的外部重复行为,以及已经存在的Skill、Custom Agent和Automation。

这里的关键变化有三处。

  • 数据源变宽:不再只看最近几段聊天,而是引入Memory、Chronicle和既有自动化资产。Codex可以从跨会话痕迹里寻找重复模式,而不是只盯着眼前这一次对话。
  • 适用人群变宽:新版明确把编码、调研、写作、规划、沟通、运营、分析、个人事务都纳入候选范围。写文章的人可以让它发现选题整理、资料核对、发布检查的重复步骤;运营人员可以让它识别周报、活动复盘、用户反馈归类这类流程。
  • 输出从建议变成行动:第一版偏向“告诉我该做什么”,第二版要求先列候选清单,再为高置信度项目直接创建,最后说明创建了什么、跳过了什么、哪些还需要更多证据。

新版提示词还加入了筛选条件,避免Codex过度抽象。只有同时满足这些特征的任务才建议打包:至少发生过两次,或未来明显会再发生且重做成本高;输入稳定,流程可重复,输出边界清楚;能明显提升速度、质量或可靠性;现有工具没有覆盖。

这套判断很实在。AI工具最怕把“偶然做过两次的临时活”包装成长期流程,结果维护成本比重做还高。Vaibhav给出的分类也比较克制:每周重复的固定流程适合做Skill;需要专门角色完成的调查任务交给Subagent;定时触发、无需人工盯守的检查做成Automation;只发生一次、边界不清的任务就Skip。

Skill、Subagent、Automation,分别适合什么活

如果把Codex看成一个会不断积累经验的工作台,Skill更像“固定手艺”。比如每周生成更新日志、按项目模板整理测试报告、检查文档是否符合团队规范。这类任务流程明确,输入输出稳定,做成Skill之后可以反复调用。

Custom Subagent更像“临时请一位专员”。它适合边界清楚但需要独立判断的任务,比如调查某个依赖库升级风险、分析一个复杂PR的影响范围、排查一组失败测试背后的共同原因。Subagent不只是执行清单,它承担一个角色。

Automation则更偏后台巡检。比如每天检查CI是否有异常、定期扫描发布前清单、在某个条件触发时自动生成提醒。人不需要每次主动开口,它自己按条件跑。

这个区分对普通用户也有参考价值。不是所有重复劳动都该自动化,也不是所有自动化都该交给同一种工具。稳定、低风险、高频的流程适合固化;需要判断但边界清楚的任务适合代理;只做过一两次、输入还没稳定的任务,最好先观察。

争议点也很现实:token、误判和抽象维护成本

评论区里有人直接喊话,希望OpenAI把这套能力做成插件,甚至开玩笑叫它“/dream”。Vaibhav本人也承认,这确实应该产品化,只是他对这个名字不太感冒。

更严肃的问题是成本。让Codex回看过去30天记录,理论上会消耗大量token。Vaibhav没有正面回应这一点。考虑到他是OpenAI内部成员,使用额度和普通用户未必一样。再加上OpenAI近期多次调整Codex速率限制,外部用户实际体验可能会有差异。

另一个问题比token更麻烦:Codex可能会把还没稳定下来的工作提前封装。有人试用后发现,自动生成的Skill里,有一半来自“输入尚未稳定、但已经做过两次”的任务。看似节省时间,后续却要不断修补这些抽象,维护成本反而超过手动再做一次。

这也是“自我蒸馏”最需要人工把关的地方。Codex可以帮你发现模式,但它不一定懂团队流程的长期价值。我的建议是,把它生成的候选清单当成一次工作流体检,而不是无脑批准。高频、稳定、可验收的任务可以让它创建;边界模糊的候选项先放进观察区,等第三次、第四次出现后再固化。

这套玩法依赖Codex近期几个关键新功能

Vaibhav这条提示词能跑起来,背后靠的是Codex最近连续上线的几个能力:Chronicle、Memory和Subagent。

Chronicle:把Codex视野扩展到聊天窗口之外

Chronicle在4月20日上线,目前仍是预览版。它通过屏幕截取的方式,让Codex看到用户在浏览器、Slack、邮件等应用中的操作痕迹。也就是说,如果你打开这个功能,Codex不只知道你在会话里问过什么,还能发现你在其他软件里反复做了哪些事。

限制也很明确:Chronicle目前只对macOS上的ChatGPT Pro订阅用户开放;记忆未加密存储在本地;会快速消耗rate limit;由于它能读取更多上下文,提示词注入风险也会变高。对公司环境来说,这类能力必须谨慎开启,尤其涉及代码仓库、内部沟通和客户资料时。

Memory:让跨会话模式变得可见

Memory功能在4月16日随Codex更新上线,同样属于预览能力。它可以记录用户偏好、修正记录和项目专属知识,并在后续会话中自动调用。没有Memory,Codex很难判断“你是不是经常这么做”;有了Memory,它才可能从多个会话里找出重复模式。

Subagent:把复杂任务拆给专门代理

Subagent功能在3月正式上线。它由一个管理Agent协调多个专门编码Agent,每个Agent运行在独立的云端沙盒中。对复杂任务来说,这比单个模型一路聊到底更像团队协作:一个代理查依赖,一个代理看测试,一个代理审PR风险,最后由管理Agent汇总。

Vaibhav本人:Codex生态里很会“整活”的那类内部用户

Vaibhav Srivastav是OpenAI Codex团队成员,也曾在Hugging Face任职,做过机器学习开发者布道师、开发者体验与社区负责人。他的X账号几乎就是一份Codex重度使用日志:用Codex处理日常事务、配置树莓派、接入家庭WiFi、远程访问设备,甚至宣称自己已经一个多月没有打开IDE,只靠Codex完成开发工作。

他还分享过另一个有意思的命令:/goal。这个命令的用法是给Codex设定一个“完成态”,告诉它任务成功时应该长什么样,然后让它持续执行,直到验证器判断目标达成。如果没有达成,主模型继续推进。

/goal从Codex 0.128.0版本开始可用,更适合大规模重构、代码迁移、长期实验,或者那些不需要太多创意、但需要持续推进和验证的任务。它和“自我蒸馏”提示词放在一起看,方向很清楚:Codex正在从问答式助手,变成一个能积累流程、拆分任务、持续执行的开发工作台。

真正有价值的不是提示词,而是让AI帮你发现流程浪费

这次走红的提示词本身并不复杂,复制粘贴就能试。但它背后的思路更值得借鉴:让AI从你的工作历史里找出重复、稳定、可验收的动作,再决定是否沉淀成工具。

对开发者来说,它可以从CI失败、PR审查、发版准备里挖出自动化机会;对内容和运营团队来说,它也能用于选题整理、资料核查、复盘模板、周报生成、沟通纪要归档。前提是别把AI的建议当圣旨。让Codex列候选,人来判断边界和收益,这个组合目前最稳。

参考来源:Vaibhav Srivastav在X发布的Codex自我蒸馏提示词与相关Codex使用分享。

© 版权声明

相关文章