告别盲目随机探索!国防科大等团队巧用“参数变化”,带强化学习走出训练深水区 强化学习无监督环境设计面临关卡价值评估开销大、方差高的痛点。国防科大等提出PACE算法,用策略参数变化量度量学习进展,精准定位最近发展区。实验显示该算法避开了额外评估开销,并在MiniGrid与Cra... AI 前沿动态# PACE算法# 强化学习# 无监督环境设计 2个月前330