怎样实现一个自学习的下棋程序
这属于强化学习模型,已有这样的应用。强化学习基本模型如下:
【怎样实现一个自学习的下棋程序】
传统的下棋程序采样min-max以及典型的蒙特卡罗采样算法(Monte Carlo)来实现。而RL通过与对手的下棋(训练,获取经验),来不断修正自己的策略,尽可能使回报最大化。当训练情节(episode)足够多时,模型会收敛,此时的策略也是最优的。RL FAQ:http://spaces.facsci.ualberta.ca/rlai/resources/rl-faq/
■网友
你还是先看看机器学习的相关知识吧,这是属于增强学习一块的。。
推荐阅读
- 聪明人养花,这3种“花”怎样也要养一盆,每年能省不少医药费
- 同比■同比增长7.1%!2021年的第一个节你花了多少钱?
- “他是我第一个会说普通话的老师”:一对师生折射青海山村蝶变
- 北京22家市属医院均开展安检基本实现重点区域安检措施全覆盖
- 长江流域渔民退捕“上岸”实现扩产新致富
- 实现“甜蜜计划”,这对中哈跨国夫妻好甜
- 北京地铁11号线西段三座车站提前实现主体结构封顶
- 有必要重新开个C店吗
- 互联网怎样解决“家政服务上门速度慢”的问题
- 怎样看待从1月8号起,QQ钱包开始提现收费
