反应策略深度强化学习的第一个主要成就是着名的DQN算法在各种Atari视频游戏中的人类水平表现 , 其中神经网络学习使用原始屏幕像素作为输入来玩游戏 。 在强化学习中 , 我们希望学习一种将状态映射到行动的政策 , 以便最大化累积的奖励 。 例如 , 在DQN论文中 , 神经网络是卷积神经网络 , 它将屏幕图像作为输入并输出可能动作的分数 。
虽然强化学习算法的设计使得该策略应该学会选择具有长期益处的行为 , 但我们从策略中获得的信息仅适用于当前状态 。 这称为响应策略 , 它是一种策略 , 将当前状态映射到应立即采取的操作 , 或映射到操作的概率分布 。
拥有完整的计划允许我们使用外部知识对其进行评估并防止采取危险行为 。 例如 , 如果自动驾驶汽车希望改变车道但是突然汽车接近非常快 , 比模拟汽车在训练期间更快 , 则外部程序可以预测当前计划的轨迹朝向碰撞并且中止操纵 。 这对于被动策略来说要困难得多 , 在这种策略中可能难以预测场景在播出之前如何结束 。
希望制定完整计划的另一个原因是它可能会使我们的政策表现更好 。 也许通过强制它提前计划 , 我们可能会限制我们的政策更加一致 , 并能够在看不见的情况下更好地调整 , 这正是我们想要的 。
马尔可夫决策过程规划问题的一个非常常见的模型是马尔可夫决策过程 , 即MDP 。 在MDP中 , 我们将世界定义为一组状态S , 一组可能采取的行动A , 一个奖励函数R和一个过渡模型P.它们一起构成了元组:
推荐阅读
-
陈友谅奢靡|陈友谅大金床,朱元璋看后发出感慨,陈汉不亡没有道理
-
医生|25岁女子,脑溢血离世,医生忠告:这种“水”天天喝,血管易崩溃
-
『碧血黄沙2019』补血就用这“三宝”!,中年女性肤色不好?小心气血不足
-
-
「刘德华」何鸿燊的故事曾被拍成电影,刘德华主演却不被赌王认可,赌王最爱周星驰
-
胖哥一叶知秋|《水浒传》中晁盖等人智取的十万贯生辰纲相当于现在多少钱?
-
落后|中国音乐落后西方音乐? 早在古代, 中国就出现了双音的奇迹
-
[针织开衫]针织开衫在秋天的优雅穿法,一眼就爱上的温柔
-
穿衣搭配|国货好用不贵的6款护肤品 真心好用的YYDS国货 用一次爱上一辈子
-
东方网|沪登山户外运动协会换届选举召开许刚接过接力棒
-
【Odaily星球日报】模拟:Eth2 Phase 0的奖惩力度
-
-
毒汤|男人最好别问!,女人这五个问题不会和男人说真话
-
崩坏3|崩坏3:新深渊到底便宜了谁?降低游戏体验,让玩家弃坑,策划和游戏有仇吗
-
ZAKER生活|交警、消防、120都来了……,两车相撞
-
【报销】姚明该愁啊!官宣:骨裂+赛季报销 cba刚开始就连传噩耗 这4人真倒霉
-
-
-
中国好声音|参加《中国好声音》被遗憾淘汰,至今却比冠军还火的歌手有哪些呢?
-
日媒:日本研发下一代的下一代电池 完全固态弃用锂采用更容易取得材料纳