拆解AlphaGo的技术遗产:为什么大模型难以直接复制树搜索奇迹?
导语:对话前DeepMind专家Eric Jang,深度拆解LLM为什么难以直接复刻AlphaGo的树搜索机制。
即便是在大语言模型(LLM)狂飙突进的今天,AI界的许多顶尖研究者在回望历史时,依然会将AlphaGo视为一座几乎无法逾越的工程丰碑。前DeepMind机器人研究科学家Eric Jang在近期的深度分享中,重新拆解了AlphaGo的核心逻辑,并直面了一个困扰当前AI产业的核心痛点:在大模型时代,我们为什么无法简单粗暴地将AlphaGo的算法奇迹复制到LLM中?
优雅的「分摊」:AlphaGo如何用神经网络收敛无穷搜索?
在很多人朴素的认知里,AlphaGo的成功似乎只是暴力算力对蒙特卡洛树搜索(MCTS)的又一次压制。然而实际情况并非如此。Eric Jang指出,AlphaGo的核心魅力在于它用一个仅有10层左右的神经网络,极其高保真地「分摊(Amortize)」了原本在数学上被视为无法直接计算的搜索空间。
这种非凡的效率,得益于神经网络与MCTS的深度共生机制:
- 价值网络(Value Network)截断深度:在每一步的搜索循环中,算法依靠价值网络对当前的对局走向进行胜率预判,在合适的位置果断截断树展开的深度,省去了推演到终局的冗余计算。
- 策略网络(Policy Network)剪枝广度:策略网络负责对高潜力的落子位置提出建议,从而将指数级发散的搜索广度大幅度收缩。
依靠这两大网络的协同,原本不可控的决策树搜索最终收敛,内化为了神经网络一次快速且稳定的前向传播(Forward Pass)。这正是计算资源在算法层面最优雅的一次释放。
长序列生成的灾难:大模型在强化学习中的「方差黑洞」
相比于AlphaGo那套能自行收敛的精细控制,大模型当前的强化学习(RL)路径要粗糙得多。当下的大语言模型在面对长逻辑轨迹时,策略梯度(Policy Gradient)算法往往会被两大数学魔咒死死扣住:偏高的梯度方差与信用分配(Credit Assignment)难题。
Eric Jang从数理层面对此进行了犀利的拆解。在多步强化学习中,当通过交叉相乘计算梯度方差时,会产生一个随着时间步长 $T$ 呈二次方增长的项。如果试图在生成的每一个Token上都分配奖励,各个项之间复杂的交互效应会直接破坏信用归因子。这导致算法很难计算出到底是哪一个特定的Token导致了生成结果的失败。
为了绕开这个死结,当前的LLM强化学习采取了一项有些妥协的机制:将整段长序列的生成视为一个单一动作(即 $T=1$ 的设定)。
在这种策略下,算法将整个序列的对数概率简单视为单个Token概率之和。虽然这在形式上规避了时序动作之间的关联性,但naive REINFORCE估算器依然不可避免地保留了极高的梯度方差。当模型在海量生成中遇到零梯度的失败样本时,由于缺乏针对特定步骤的反馈,模型根本无法进行有效训练。因此,工业界必须依赖数百万级别的超大规模样本量,才能从沙子里淘金似地提取出前向演进的监督信号。这正是当前大模型RL训练耗资巨大的底层原因之一。
从MCTS获取启示:如何绕过信用分配的死胡同?
那么,AlphaGo为什么能够轻松避开信用分配的泥潭?
答案在于它独特的反馈模式。MCTS不再试图基于游戏的最终胜负来倒推信用,而是利用树搜索为模型所经历的每一个行动输出「效果更好的标签(Label Improvement)」。
只要我们拥有一个及格的价值函数,MCTS在未访问过的路径上进行前向规划时,就能给出比模型初始猜测好得多的策略反馈。它充当了一个「始终比现在的你更聪明」的实时导师。无论是围棋中的MCTS,还是那些无法进行完美树搜索的复杂游戏(例如《星际争霸》)中所采用的神经虚拟自我对弈(NFSP),基本逻辑都在于:利用搜索或者最佳响应策略,用更好的行动标签去重新标记历史状态。这种机制绕开了漫长轨迹中的信用分配难题,成功将无监督的黑盒探索转化为了强监督的学习过程。
为什么我们无法把MCTS直接「塞进」大语言模型?
既然MCTS在棋类游戏中宛如神迹,直接照搬到LLM生成中不就行了吗?对此,Eric Jang给出了否定的回答。大语言模型所面对的无界信息空间,与围棋有着天壤之别。
首先是空间规模和确定性的灾难。围棋是在19×19的棋盘上进行边界清晰、规则刚性的博弈,落子空间极其有限。而语言生成的每一个Token背后,是高达数万甚至十万级别的词表空间(Action Space),其在语义层面的分支结构呈指数级膨胀,并且没有任何物理引擎或规则裁判能对半途中的话语给出一个绝对科学的「胜率值」。在如此发散且缺乏精确价值评估器的环境下,经典的树搜索会迅速崩塌,算力会在无边际的发散中消耗殆尽。
但这并不意味着AlphaGo的技术遗产在语言模型时代失去了意义。Eric Jang揭示了一个至关重要的演进方向:算力置换。
未来的前沿大模型可能不需要显式的、在内存中动态维护的树状数据结构。相反,伴随着训练范式的革新(例如思维链推理的自监督优化与测试时计算理论的结合),大模型在训练阶段通过强有力的状态重标记,将复杂的推理搜索打包进参数中,最终将其内化为前向传播过程。这种隐藏在模型权重内部的、内生化的逻辑推理与自我纠偏,或许才是通往通用人工智能(AGI)更为坚实的一步。