Rmsprop方法是怎样利用Rprop方法的优点,进行改进的( 二 )
从Rporp到RMSpropRporp常常运用于全数据集的运算,简单地说,为梯度添加最小限制的同时也减小了梯度的容错率。详细地说,假设采用Mini Batch进行10步梯度运算,得出前9步梯度为
而最后一步梯度为
,当这种情况发生时最好的做法时正负梯度抵消,总梯度值尽量保持不变,而Rprop则会进行9次梯度减少和1次梯度增加,造成梯度的严重失衡(当然这里取决于梯度上下限的设置,但是总能找到极端情况)。
为此,引入RMSprop:
其中
是梯度,
作为一个值容器承载着梯度平方加权平均的结果,并且作为梯度缩放的因子。
是学习率,
则类似于动量梯度下降法中的衰减因子,代表过去梯度对当前梯度的影响,一般取值
。
这样子,用梯度自身的大小约束自身避免过大或者过小,减少了人为干预和极端情况发生的可能。在引入Mini Batch的同时不割裂各个Mini Batch之间的梯度关系,就从Rprop算法进化到了RMSprop。
以上就是RMSprop的关键内容,下面是一些细节性的不重要内容,可以忽略
不重要的附录:
中对梯度平方个人认为是为了保证非负
的根号中,为了避免出现0,往往会加上极小值
。相关代码块:Rprop关键代码for t in range(num_interations): dw = compute_gradient(x, y) if dw * dw \u0026gt; 0: step_size = min(step_size * incFactor, step_size_max) elif dw * dw \u0026lt; 0: step_size = max(step_size * decFactor, step_size_min) w = w - sign(dw) * step_sizeRMSprop关键代码drad_squared = 0for _ in num_iterations: dw = compute_gradients(x, y) grad_squared = 0.9 * grads_squared + 0.1 * dx * dx w = w - (lr / np.sqrt(grad_squared)) * dw文章部分参考自外文博客markdown和latex功能很差劲,欢迎到直接到我的博客观看RMSprop
■网友
Momentum是为了对冲mini-batch带来的抖动。
RMSprop是为了对hyper-parameter进行归一。
【Rmsprop方法是怎样利用Rprop方法的优点,进行改进的】 这两个加起来就是Adam了。
推荐阅读
- 聪明人养花,这3种“花”怎样也要养一盆,每年能省不少医药费
- 长寿花怎么养护?掌握两大方法,乖乖花开“爆盆”,花香四溢!
- 互联网怎样解决“家政服务上门速度慢”的问题
- 怎样看待从1月8号起,QQ钱包开始提现收费
- 银行it人怎样转型
- 汽车|冬天怎样让车内温度快速升高?座椅加热的最佳使用方式二,外循环的作用总结
- 怎样进入通信行业
- 怎样评价扶他柠檬茶的小说《云养汉》的结尾
- 有啥方法,网站,项目可以自己练习计算广告学
- 直播会成为品牌传播的另一个途径么有哪些可行的方法感觉有戏又没头绪好捉急。
