为啥weight decay能够防止过拟合
过拟合(overfitting,或称拟合过度)是指过于紧密或精确地匹配特定(训练)数据集,以致于无法良好地拟合其他数据或预测未来的观察结果的现象。
过拟合通常由于数据相对有限而且参数过多或者结构过于复杂的统计模型引起。
在下图中,绿线代表过拟合模型,黑线代表正则化模型。虽然绿线完美的符合训练数据,但拟合得太过紧密或精确;并且与黑线相比,在新的测试数据上会有更高的错误率。 
在机器学习中,为了避免或减轻过拟合现象,须要使用额外的技巧,如模型选择、交叉验证、提前停止、正则化(Regularization)、剪枝、贝叶斯信息量准则、赤池信息量准则或dropout。
正则化是指为解决适定性问题或过拟合而加入额外信息的过程。而正则化又包括L1,L2等,其中L2 regularization又叫做权重衰减(weight decay)。
L2 regularization(权重衰减)L2正则化就是在代价函数后面再加上一个正则化项: 
其中C0代表原始的代价函数,后面那一项就是L2正则化项,它是这样来的:所有参数w的平方的和,除以训练集的样本大小n。λ就是正则项系数,权衡正则项与C0项的比重。另外还有一个系数1/2,1/2经常会看到,主要是为了后面求导的结果方便,后面那一项求导会产生一个2,与1/2相乘刚好凑整为1。系数λ就是权重衰减系数。
直观上:算法会在训练过程中梯度下降迭代时期望代价函数C尽量的小,而这通常就需要更多更复杂的参数(导致过拟合的原因)。而加上L2正则化项之后,当参数变多变复杂时会导致L2正则化项增大,从而使代价C增加,这样就达到了制衡参数的目的。
数学原理上:我们对加入L2正则化后的代价函数进行推导,先求导: 
可以发现L2正则化项对b的更新没有影响,但是对于w的更新有影响:
在不使用L2正则化时,求导结果中w前系数为1,现在w前面系数为1-ηλ/n,因为η、λ、n都是正的,所以1-ηλ/n小于1,它的效果是减小w,这也就是权重衰减(weight decay)的由来。当然考虑到后面的导数项,w最终的值可能增大也可能减小。
那为什么w变小可以防止过拟合呢?从模型的复杂度上解释:更小的权值w,从某种意义上说,表示网络的复杂度更低,对数据的拟合更好(这个法则也叫做奥卡姆剃刀),而在实际应用中,也验证了这一点,L2正则化的效果往往好于未经正则化的效果。
从数学方面的解释:过拟合的时候,拟合函数的系数往往非常大,为什么?如下图所示,过拟合,就是拟合函数需要顾忌每一个点,最终形成的拟合函数波动很大。在某些很小的区间里,函数值的变化很剧烈。这就意味着函数在某些小区间里的导数值(绝对值)非常大,由于自变量值可大可小,所以只有系数足够大,才能保证导数值很大。而正则化是通过约束参数的范数使其不要太大,所以可以在一定程度上减少过拟合情况。 
查看我的更多相关回答:
溪亭日暮:汇编 | 我的AI 技术回答
参考 维基百科:过拟合. https://zh.wikipedia.org/wiki/%E9%81%8E%E9%81%A9 权重衰减与学习率衰减. https://blog.csdn.net/program_developer/article/details/80867468
推荐阅读
- 为啥看到书柜上的藏书会有心旷神怡的感觉
- 为啥知乎上普便有一种【我在北上广深打工,所以拥有更好的视野】这样的错觉
- 为啥工商银行的用户体验如此之差
- 汽车|看了中消协4S店服务测评调查结果,终于知道法系车为啥卖不好了
- 你为啥从窝窝商城离职?
- 为啥5G和2.4G默认的BSSID是相同的
- 为啥电器实体店的价格比淘宝贵那么多
- 现在在线学习视频有很多了,为啥大部分人还是喜欢下载下来观看
- 为啥到现在你还没有女朋友 ?
- 天赐的声音|33岁张雨绮为啥总离婚?看过这些照片就明白了,都是性感惹得祸
