board game里reinforcement learning里的状态序列是指啥

感谢@Lee Manners感觉题主先把结构搞清楚,reinforcement learning最本的结构,如下图:board game里reinforcement learning里的状态序列是指啥
【board game里reinforcement learning里的状态序列是指啥】
对着这个框架图,把agent,environment, state,action,reward 写出来,这样就不会乱了吧。希望可以帮到你哦~~~
■网友
谢邀。RL使用左图,将对手视为环境。我方先走,S0对应的围棋的空盘,或者象棋刚摆好全部棋子的初始状态。 MDP:你是一个有失忆症的人(韩剧?金鱼?)。每一次轮到你走。你的就当第一次来过,面对残局,走一步。然后离开座位,对手走棋。下一次来,就好像没来过。@玉博玉 怎么看《Reinforcement Learning: An Introduction》一章 Figure 1.1 那个图,是对手先走。 你可能弄混淆了。=======================================中间那个图,s1-\u0026gt;s2是对手下棋过程,这个不是RL问题。 需要给对手进行建模。 也就是说,你可以猜对手下哪一步(而且猜的准确率还可以)。然后倒推你的策略。可以参考别的学派看法。
■网友
在强化学习中,状态序列是左边的。agent是decision maker, 它以外的都被视为环境(enviroment)。agent 主动执行一个action, 环境对应给出一个状态(以及reward),agent以此再执行一个行动,如此进行下去。具体在你问题中,我方下一步棋(action),导致棋局变了,对方对应走一步棋,棋局又变了,此刻的棋局是状态,我方根据这个状态来执行下一步行动的。图中,中间那个信息完全状态序列,是传统人工智能博弈树搜索过程展现出的状态序列,和强化学习的状态序列是两个不同概念。


    推荐阅读