假设我们的代理位于地图的左下角 , 并且必须安全地导航到绿色区块 。 必须区分规划轨迹或寻找政策 。 如果我们计划一个轨迹 , 我们将得到一个序列 , 指定应该采取行动的顺序 , 例如:(向上 , 向上 , 向右 , 向右 , 向右) 。 如果我们的问题是确定性的 , 选择一个方向会使我们的代理人在这个方向上有100%的机会 , 那么这将对应于轨迹:
但回到我们的例子 , 我们如何才能找到如上图所示的最优政策?对于称为值迭代的这类问题 , 存在一种经典算法 。 该算法的作用是计算当前处于某种状态可以实现的长期利益 , 通过提出问题"如果我从这个状态开始 , 我能获得的最大利润是多少?" 。 这个数量被称为MDP术语中的状态值 , 直观上很容易看出 , 如果我们知道每个州的价值 , 我们可以尝试始终转移到具有更高价值的国家并从中获益 。
假设我们知道问题中所有状态的最优值;V*(s) , 我们现在可以定义从我们的州采取特定行动并从此采取最佳行动的价值;Q*(S , A) 。
推荐阅读
-
-
「医心爱分享」枇杷甜水,把隔壁小孩馋哭了!枇杷红枣加生姜绝配,保护小儿脾胃
-
汽车老车手|拼多多回应来了,特斯拉拒绝向拼多多用户交付新车
-
-
-
-
『央视』中国驻赤道几内亚大使馆向赤几方捐赠抗疫物资
-
-
江疏影生日跳7rings|身材火辣!江疏影生日跳7rings,舞台实力杠杠滴!!
-
央视新闻客户端|印度内政部长新冠初愈 胸部感染又住院
-
澎湃新闻|牛市来了|十大券商解盘:市场如期调整,谨防较强震荡
-
-
-
我是美国的留学生拿的F1签证想去台湾旅游再从台湾回国不想跟团需要啥手续
-
崩坏3|崩坏3:粉毛增幅前:疯疯癫癫,粉毛增幅后:霸气外露!
-
-
【国际米兰】马洛塔再施免签大法!国米一天搞定两笔签约,两大前锋夏季加盟
-
-
-