阿尔法元的真正实力

2024-05-07 04:39
1. 阿尔法元的真正实力

阿尔法元（AlphaGo Zero）仅拥有4个TPU（神经网络训练专用芯片），零人类经验，从空白状态学起，在无任何人类输入的条件下，AlphaGo Zero能够迅速自学围棋。其自我训练的时间仅为3天，自我对弈的棋局数量为490万盘。并以100:0的战绩击败“前辈”AlphaGo等。

发展历史：
2017年10月19日凌晨，在国际学术期刊《自然》（Nature）上发表的一篇研究论文中，谷歌下属公司Deepmind报告新版程序AlphaGo Zero：从空白状态学起，在无任何人类输入的条件下，它能够迅速自学围棋，并以100:0的战绩击败“前辈”。
Deepmind的论文一发表，TPU的销量就可能要大增了。其100:0战绩有“造”真嫌疑。它经过3天的训练便以100：0的战绩击败了他的哥哥AlphaGo Lee，经过40天的训练便击败了它的另一个哥哥AlphaGo Master。
“抛弃人类经验”和“自我训练”并非AlphaGo Zero最大的亮点，其关键在于采用了新的reinforcement learning（强化学习的算法），并给该算法带了新的发展。
阿尔法元的真正实力