为啥weight decay能够防止过拟合( 二 )


■网友
weight decay/ l2 norm做的事说白了就是使求得解的weight变小。而为什么小的weight能够防止过拟合可以反过来看:数据集中“独特”的点往往需要较大的weight值来拟合,直观一点,就是weight越大model的曲线越“陡峭”,因而能够去拟合到那些位置较偏的点,这就会导致了过拟合。使用weight decay/ l2 norm就是抑制model的expressiveness从而防止了过拟合。
而且实际上,被decay的weight都是无助于目标函数减小方向的对应分量,具体理论分析Goodfellow的《Deep Learning》书上有。

■网友

为啥weight decay能够防止过拟合



■网友
weight decay 正则都是经验性操作。
建议去了解下谱归一化
本质是让神经网络的梯度平缓 简而言之就是 与数据集差不多的测试数据 经过网络的输出差不多

■网友
留个坑,
现代神经网络的 weight decay 还有 基于范数的正则化,为什么生效,是否真的生效。其实是存疑的。
因为 大多数网络包含BN,所以方差偏差分解其实没什么道理。
同时过参数化的一些研究,也可以说明人们对先验知之甚少。

■网友
【为啥weight decay能够防止过拟合】 简单的说,weight decay实际上是用权重的模来刻画网络的复杂度,并将复杂度最小化作为优化的目标之一。而我们都知道网络复杂度和网络的泛化性能密切相关,对复杂度进行约束就可以改善网络的泛化性能。 当然,这个基于权重模的复杂度度量不一定是一个非常好的度量,但是实践表明这至少是一个可用的度量,可以改善系统的性能。


推荐阅读