怎样评价Google Brain近期提出的World Models( 二 )


好在记忆模型的输出层是MDN,换句话说,输出是混合高斯分布,这使得我们可以通过调整温度参数来增加随机性。这一方面增加了控制者通过破解“作弊”的难度,另一方面,适当增加温度参数,可以增加挑战性。而在高温(高难度)梦境下训练的agent,迁移到现实环境时,通常会有更好的表现。这其实和一般模拟考试难度会比正式考试高是一个道理。当然,温度参数太高,随机性过高,难度太大,agent也无法成功学习。
除了在梦境中可以方便地增加难度,更好地训练agent外,梦中学习还节省了资源(游戏引擎需要将大量计算资源用于渲染图像,以及进行一些和游戏不直接相关的物理计算)。
图片来源:Ha and Schmidhuber, "World Models", 2018.

■网友
world model和传统dyna是否有区别:
https://stackoverflow.com/questions/50938166/dyna-q-vs-imagination-augmented-agents-for-deep-reinforcement-learning一大堆类似idea的paper:
https://www.reddit.com/r/reinforcementlearning/comments/87nya1/world_models_can_agents_learn_inside_their_own/

■网友
这篇文章写得更简洁易懂,推荐:
谷歌大脑的“世界模型”(World Models)与基因学的一些思考,MDN-RNN与Evolution Strategies结合的初体验与源码

■网友
其实也算是一种model based强化学习,而model based肯定是未来强AI的大方向。deepmind做这方面尝试很不错,只不过净喜欢搞些UC版标题
■网友
坐等universal model出来。。

■网友
现在深度学习论文标题越来越爱吹牛了,其实就是杨乐坤讲的预测学习(强化学习),机器学习系统建立世界模型不是一个新的大方向,而是一直都在积极推进。本文的一个亮点就是在脑海里复现情景然后在复现的情景里(强化学习)学习。

■网友
没有超级计算功能,如量子计算机,无法做出仿真的地球模型。


推荐阅读