怎样实现一个自学习的下棋程序

这属于强化学习模型,已有这样的应用。强化学习基本模型如下:怎样实现一个自学习的下棋程序
【怎样实现一个自学习的下棋程序】
传统的下棋程序采样min-max以及典型的蒙特卡罗采样算法(Monte Carlo)来实现。而RL通过与对手的下棋(训练,获取经验),来不断修正自己的策略,尽可能使回报最大化。当训练情节(episode)足够多时,模型会收敛,此时的策略也是最优的。RL FAQ:http://spaces.facsci.ualberta.ca/rlai/resources/rl-faq/
■网友
你还是先看看机器学习的相关知识吧,这是属于增强学习一块的。。


    推荐阅读