“Zero提高了计算效率,并且没有使用到任何人类围棋数据,”AlphaGo之父、DeepMind联合创始人兼 CEO 戴密斯·哈萨比斯(Demis Hassabis)说。AlphaGo此前的版本,结合了数百万人类围棋专家的棋谱,以及强化学习的监督学习进行了自我训练。在战胜人类围棋职业高手之前,它经过了好几个月的训练,依靠的是多台机器和48个TPU(谷歌专为加速深层神经网络运算能力而研发的芯片)。AlphaGo Zero的能力则在这个基础上有了质的提升。最大的区别是,它不再需要人类数据。也就是说,它一开始就没有接触过人类棋谱。研发团队只是让它自由随意地在棋盘上下棋,然后进行自我博弈。AlphaGo Zero强化学习下的自我对弈。经过几天的训练,AlphaGo Zero完成了近5百万盘的自我博弈后,已经可以超越人类,并击败了此前所有版本的AlphaGo。DeepMind团队在官方博客上称,Zero用更新后的神经网络和搜索算法重组,随着训练地加深,系统的表现一点一点地在进步。自我博弈的成旦闭芦绩也越来越好,同时,神经网态凳络也变得更准确。AlphaGo Zero习得知识的过程“这些技术细节强于此前版本的原因是,我们不再受到人类知识的限制,它可以向围模带棋领域里最高的选手——AlphaGo自身学习。” AlphaGo团队负责人大卫·席尔瓦(Dave Sliver)说。
相关文章
-
阿尔法狗与李世石第三局现场解说谱
2023-10-22 15:23 阅读(629) -
阿尔法特种部队,信号旗特种部队
2023-07-11 05:59 阅读(618) -
阿尔法罗密欧4c参数
2023-06-10 10:37 阅读(618)
1 zero是什么牌子
597 阅读
2 zeros在matlab 中是什么意思?
626 阅读
3 alphago能下载吗
639 阅读
4 ZERO动漫论坛今天为什么进不去
595 阅读
5 阿尔法符号是什么?
710 阅读