假设我们的代理位于地图的左下角 , 并且必须安全地导航到绿色区块 。 必须区分规划轨迹或寻找政策 。 如果我们计划一个轨迹 , 我们将得到一个序列 , 指定应该采取行动的顺序 , 例如:(向上 , 向上 , 向右 , 向右 , 向右) 。 如果我们的问题是确定性的 , 选择一个方向会使我们的代理人在这个方向上有100%的机会 , 那么这将对应于轨迹:
但回到我们的例子 , 我们如何才能找到如上图所示的最优政策?对于称为值迭代的这类问题 , 存在一种经典算法 。 该算法的作用是计算当前处于某种状态可以实现的长期利益 , 通过提出问题"如果我从这个状态开始 , 我能获得的最大利润是多少?" 。 这个数量被称为MDP术语中的状态值 , 直观上很容易看出 , 如果我们知道每个州的价值 , 我们可以尝试始终转移到具有更高价值的国家并从中获益 。
假设我们知道问题中所有状态的最优值;V*(s) , 我们现在可以定义从我们的州采取特定行动并从此采取最佳行动的价值;Q*(S , A) 。
推荐阅读
-
中评社|香港《中评社》:中山论坛启示多 两岸交流潜力大
-
互联网科技秀 分享潮牌Tezo Spark入耳式蓝牙耳机,游戏快人一步
-
-
-
「名字」中国这4个省会,名字太占便宜,让人看一眼就记住,或许
-
“我们的中国梦”——文化进万家活动在全国基层广场村镇社区深入
-
-
-
【巴西】这就是亲美下场,总统带队22人访问美国,如今17人被确诊感染
-
-
-
【车技集合】高配不到10万,第三排也舒适,7万级7座国产SUV
-
-
-
[博智客]为何独缺美国?俄罗斯:必须中国点头,全球60国请求加入“组织”
-
-
-
织音|“织音币”骗局:赴成都织音公司,其回应自己才是“最大受害者”
-
第三批国家药品集中采购8月20日上海开标,涉及56个品种
-
Alone小斌3名同事合伙创业,为亚马逊等客户提供视频制作服务,月入60万