阿尔法狗再进化 AlphaGo Zero是什么工作原理是什么-知识解答

阿尔法狗再进化 AlphaGo Zero是什么工作原理是什么

“Zero提高了计算效率，并且没有使用到任何人类围棋数据，”AlphaGo之父、DeepMind联合创始人兼 CEO 戴密斯·哈萨比斯（Demis Hassabis）说。AlphaGo此前的版本，结合了数百万人类围棋专家的棋谱，以及强化学习的监督学习进行了自我训练。在战胜人类围棋职业高手之前，它经过了好几个月的训练，依靠的是多台机器和48个TPU（谷歌专为加速深层神经网络运算能力而研发的芯片）。AlphaGo Zero的能力则在这个基础上有了质的提升。最大的区别是，它不再需要人类数据。也就是说，它一开始就没有接触过人类棋谱。研发团队只是让它自由随意地在棋盘上下棋，然后进行自我博弈。AlphaGo Zero强化学习下的自我对弈。经过几天的训练，AlphaGo Zero完成了近5百万盘的自我博弈后，已经可以超越人类，并击败了此前所有版本的AlphaGo。DeepMind团队在官方博客上称，Zero用更新后的神经网络和搜索算法重组，随着训练地加深，系统的表现一点一点地在进步。自我博弈的成旦闭芦绩也越来越好，同时，神经网态凳络也变得更准确。AlphaGo Zero习得知识的过程“这些技术细节强于此前版本的原因是，我们不再受到人类知识的限制，它可以向围模带棋领域里最高的选手——AlphaGo自身学习。” AlphaGo团队负责人大卫·席尔瓦（Dave Sliver）说。

相关文章

阿尔法狗与李世石第三局现场解说谱

阿尔法特种部队，信号旗特种部队

阿尔法罗密欧4c参数

1 zero是什么牌子

2 zeros在matlab 中是什么意思？

3 alphago能下载吗

4 ZERO动漫论坛今天为什么进不去

5 阿尔法符号是什么？