搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款( 二 )


AdaBelief考虑分母中梯度的符号
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

在左图中 , 我们考虑一个损失函数 f(x,y)=|x|+|y| 。 蓝色的向量表示梯度 , x表示最优点 。 优化器在y方向上震荡 , 在x方向上继续前进 。 右图是左图对应的优化过程 。 我们可以观察到 , 在Adam中 ,,因此 , 它在x方向和y方向上步长一样 。 但在AdaBelief 中 ,, 因此它在x方向上步长较大 , 在y方向上步长较小 。
在方差较小时 , Adam中的更新方向接近于「符号下降」
我们假设:
1.g_t来自一个平稳分布 , 因此 , 在偏置矫正之后 ,
2.低噪声假设 , 假设
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

,可以得到
3.低偏置假设 , 假设 很小 , 那么作为 估计值的m_t的偏置 就很小 。 此时 ,
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

在这种情况下 , Adam的表现很像「符号下降」 。 在2D 的例子中 , 更新是 ±45° , 因此偏离了真正的梯度方向 。 符号更新效应可能导致自适应方法和SGD之间的泛化差距 。 但在AdaBelief中 , 当g_t的方差对于所有坐标都相同时 , 更新方向会与梯度方向匹配 。 当方差不均匀时 , AdaBelief会在方差大(小)时采取小(大)步长 。
以下是几个简单问题的验证结果:
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

实验
图像分类
研究者在Cifar10和Cifar100数据集上利用VGG11、ResNet34和DenseNet121进行了实验 。 如下图4所示 , AdaBelief与自适应方法(如Adam)一样实现了快速收敛 , 同时比SGD和其他方法具有更高的准确率 。
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

研究者还在ImageNet上训练了ResNet18 , 验证集上的准确率如表2所示 。 从结果可以看出 , AdaBelief优于其他自适应方法 , 并达到了与SGD相当的准确率(70.08VS70.23) , 这缩小了自适应方法与SGD之间的泛化差距 。
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

时间序列建模
研究者在Penn TreeBank数据集上利用LSTM进行了实验 , 测试集上的困惑度(perplexity)如图5所示(越低越好) 。 对2层和3层LSTM模型来说 , AdaBelief都实现了最低的困惑度 , 验证了其具有自适应方法的快速收敛性和良好的准确率 。 对于1层模型而言 , AdaBelief的性能接近于其他优化器 。
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

GAN
研究者利用Wasserstein-GAN(WGAN)和WGAN-GP进行了实验 。 对于每个优化器 , 在其最佳超参数设置下 , 研究者进行了5轮实验 , 实验结果如图6和图7所示 。 AdaBelief明显由于其他优化器 , 并且其FID分值最低 。
搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款
本文图片

搜狐新闻|速度堪比Adam,准确率媲美SGD,还能稳定训练GAN:全新优化器成为NeurIPS爆款


推荐阅读