反应策略深度强化学习的第一个主要成就是着名的DQN算法在各种Atari视频游戏中的人类水平表现 , 其中神经网络学习使用原始屏幕像素作为输入来玩游戏 。 在强化学习中 , 我们希望学习一种将状态映射到行动的政策 , 以便最大化累积的奖励 。 例如 , 在DQN论文中 , 神经网络是卷积神经网络 , 它将屏幕图像作为输入并输出可能动作的分数 。
虽然强化学习算法的设计使得该策略应该学会选择具有长期益处的行为 , 但我们从策略中获得的信息仅适用于当前状态 。 这称为响应策略 , 它是一种策略 , 将当前状态映射到应立即采取的操作 , 或映射到操作的概率分布 。
拥有完整的计划允许我们使用外部知识对其进行评估并防止采取危险行为 。 例如 , 如果自动驾驶汽车希望改变车道但是突然汽车接近非常快 , 比模拟汽车在训练期间更快 , 则外部程序可以预测当前计划的轨迹朝向碰撞并且中止操纵 。 这对于被动策略来说要困难得多 , 在这种策略中可能难以预测场景在播出之前如何结束 。
希望制定完整计划的另一个原因是它可能会使我们的政策表现更好 。 也许通过强制它提前计划 , 我们可能会限制我们的政策更加一致 , 并能够在看不见的情况下更好地调整 , 这正是我们想要的 。
马尔可夫决策过程规划问题的一个非常常见的模型是马尔可夫决策过程 , 即MDP 。 在MDP中 , 我们将世界定义为一组状态S , 一组可能采取的行动A , 一个奖励函数R和一个过渡模型P.它们一起构成了元组:
推荐阅读
-
|60㎡港式小户型经典时尚,堪称教科书级别设计,非常值得借鉴!
-
挥斥方裘|看到报告后,普京气的脸色发白,俄罗斯境内却出现“红色河流”
-
-
-
篮球资讯快递|八一男篮离队第一人确定:“中国便士”退役,加盟CBA冠军球队
-
RNG|WE香克斯,海鲜哥迎来首秀,RNG和VG全队出击,今天的比赛不能错过
-
-
【月季花】“四季龙沙”月季,花美若粉龙,四季开花,养护容易,室内也能种
-
-
绝经女人绝经后别放弃!做到4点也能延缓衰老的速度,早做早受益
-
-
素炒三丝是哪三丝?炒三丝,是那三丝咯?谢谢了,大神帮忙啊?
-
金十数据:3月危险一幕会否重演?,千吨黄金准备“空运”到美国
-
视觉美学|全网都羡慕杜海涛,沈梦辰身材有多绝?看到她穿上堆堆袜的腿型后
-
#小小星座m#心怀旧爱,不可救药,3星座破镜重圆,再次抱紧-,未来20天
-
纯阳|我的侠客纯阳拳怎么搭配好?我的侠客纯阳拳武学天赋搭配推荐
-
海沃德|捧绿军湖人?联盟临时修改赛程,海沃德能复出了,热火成最大输家
-
-
别克君威|别克君威销量回升了?消费者为什么为它买单?是运动吗?
-