拆解AlphaGo的技术遗产:为什么大模型难以直接复制树搜索奇迹? 大语言模型强化学习面临信用分配与梯度方差暴增的痛点。前DeepMind科学家Eric Jang深入剖析AlphaGo,指出其依靠MCTS与价值网络进行状态重标记分摊搜索空间,而LLM因词表庞大且无规则... AI 前沿动态# AlphaGo# MCTS# 信用分配 2个月前340
多跳推理性能飙升20%!Search-R2将纠错纳入策略空间,破解搜索增强推理的长链信用分配难题 腾讯混元、MBZUAI和港中文联合提出Search-R2框架,将纠错纳入强化学习策略空间,有效解决长链搜索推理中的错误传播问题,在多跳推理任务中性能提升超20%,为搜索型智能体提供了更贴近真实失败模式... AI 前沿动态# MBZUAI# Search-R2# 信用分配 2个月前310