关键观点
神经网络同时压缩搜索的宽度与深度
围棋的朴素博弈树既宽又深:开局最多约有 361 个选择,完整对局可能持续约 300 步。策略网络为动作赋予先验概率,使搜索优先考虑少数有希望的分支;价值网络直接估计当前局面的胜率,使搜索不必走…展开观点收起观点
围棋的朴素博弈树既宽又深:开局最多约有 361 个选择,完整对局可能持续约 300 步。策略网络为动作赋予先验概率,使搜索优先考虑少数有希望的分支;价值网络直接估计当前局面的胜率,使搜索不必走到终局。AlphaGo 的关键因此不是消灭搜索,而是把大量重复搜索摊销进神经网络。
为什么重要: 这说明学习系统可以把难以承受的在线计算转化为一次快速近似,为推理时计算与训练时计算之间的交换提供了范式。
支撑证据
Conceptually, there are two problems: the breadth of the tree and the depth of the tree. AlphaGo gives us a way to shrink both of those to be tractable.
MCTS 是边建树边搜索的四阶段循环
每次模拟依次执行选择、扩展、评估和回传。选择阶段用 PUCT 综合平均动作价值、策略先验与探索奖励;遇到未展开节点后,系统创建子节点并用网络估值;最后把叶节点价值沿路径回传,更新访问次数和平均…展开观点收起观点
每次模拟依次执行选择、扩展、评估和回传。选择阶段用 PUCT 综合平均动作价值、策略先验与探索奖励;遇到未展开节点后,系统创建子节点并用网络估值;最后把叶节点价值沿路径回传,更新访问次数和平均价值。最终动作通常依据根节点各子节点的访问次数分布决定。
为什么重要: 这一循环让系统只扩展稀疏而有价值的路径,避免预先构造无法存储的完整博弈树。
支撑证据
Every simulation involves this four-step process: selection, expansion, evaluation, and backup.