零梯度更新!OpenAI新范式HL只用.py文件就拿下Atari满分,强化学习迎来代码时代?

导语:OpenAI新范式HL不依赖梯度更新,用代码取代神经网络,在Atari和机器人任务中达到顶级性能。

OpenAI核心研究员翁家翌提出了一种全新的强化学习范式——启发式学习(Heuristic Learning, HL),彻底颠覆了传统深度强化学习的底层逻辑。它不依赖神经网络训练,不更新任何参数,仅凭一个可读的.py文件就能在经典Atari游戏Breakout上取得864分理论满分。

零梯度更新!OpenAI新范式HL只用.py文件就拿下Atari满分

全程无神经网络训练、无梯度更新,由GPT-5.4驱动的Codex自主迭代代码,最终达成满分。

零梯度更新!OpenAI新范式HL只用.py文件就拿下Atari满分

传统深度强化学习的三大瓶颈

传统DRL默认智能体决策核心必须依托神经网络。例如在游戏中,观测到球在左侧时,神经网络通过复杂映射输出“向左移动”,但整个过程是隐式黑箱,无法拆解。这种架构导致三大核心瓶颈:

  • 灾难性遗忘:参数存储技能,新任务梯度会覆盖旧权重,无法持续学习。
  • 决策黑箱:动作选择隐藏在海量权重与矩阵运算中,无法追溯或干预。
  • 样本效率低下:依赖海量交互数据,收敛慢、算力消耗大。

启发式学习:将策略转化为代码

HL的思路直接:既然参数更新是问题根源,那就不要参数。它将决策策略从神经网络权重转化为可读的程序代码,将学习从梯度优化变为代码编辑。在HL框架中,AI维护的不是单一策略文件,而是一套完整软件系统:显式状态检测器(如“球在左上方,速度向右”)、显式规则逻辑(如“如果球将落在左侧,则向左移动”)、测试用例、回归检查、失败记录、版本历史。每次迭代,Codex审视系统表现,阅读失败录像,分析日志,做出结构性调整。

零梯度更新!OpenAI新范式HL只用.py文件就拿下Atari满分

这种范式的关键优势是知识显式化。旧能力不会被覆盖,而是封装成模块和测试,随时可调用、可验证、可传承。HL将持续学习从“如何更新参数”变为“如何维护一个持续吸收反馈的软件系统”。虽然HL内部某些组件(如模型预测控制MPC)仍使用梯度进行局部搜索,但梯度运算不用于神经网络训练与参数更新,仅服务于实时动作决策。

零梯度更新!OpenAI新范式HL只用.py文件就拿下Atari满分

这种架构让HL原生具备可解释、抗遗忘、高效率的特性。

Atari满分,机器人控制达SOTA

HL不仅在Breakout上拿到864分,还在完整的Atari 57基准测试中完成大规模验证(57款经典游戏)。每款游戏设两种观测模式,各重复三轮,共生成342条独立迭代轨迹。结果显示,在统一环境交互步数下,HL的整体中位表现已与PPO等主流DRL算法持平。在Breakout、Asterix、Jamesbond等多款游戏中,成绩甚至超越人类玩家。

在更复杂的MuJoCo机器人连续控制任务中,以四足机器人Ant为例,需协同调控8个关节维持动态平衡。HL从基础节律步态起步,逐步加入姿态反馈、触地信号感知、短程模型预测等逻辑,最终评分突破6000分,性能对标专业深度强化学习模型。

零梯度更新!OpenAI新范式HL只用.py文件就拿下Atari满分

在HalfCheetah猎豹仿真任务中,HL更是跑出11836的平均高分,展现出在复杂连续控制场景的极强适配能力。

局限性:无法替代神经网络感知

翁家翌坦承HL的边界:目前无法想象有智能体仅靠纯Python代码、不用神经网络去解决ImageNet。从原始像素中完成目标识别与特征抽象,仍是深度神经网络的强项。HL的核心价值集中在策略持续迭代层面,当环境动态变化、需要长期自适应调整行为逻辑时,显性化的代码规则系统更适配持续学习需求。

未来方向:神经网络与HL融合

当下的关键命题在于如何将神经网络与HL有机融合,攻克在线学习与持续学习两大难题。翁家翌指出,最具落地前景的思路是:依托HL实时处理在线环境数据流,快速沉淀可复用的在线行为经验;再将这些显性经验整理、内化,转化为可训练、可回归、可筛选的高质量数据集,反过来对神经网络做周期性迭代更新。

参考链接:
[1] https://x.com/Trinkle23897/status/2052596837547495549
[2] https://trinkle23897.github.io/learning-beyond-gradients

© 版权声明

相关文章

暂无评论

none
暂无评论...