『技术』数据分析师必须掌握的7个回归分析方法( 三 )


  • 标准逐步回归法做两件事情 。 即增加和删除每个步骤所需的预测 。
  • 向前选择法从模型中最显著的预测开始 , 然后为每一步添加变量 。
  • 向后剔除法与模型的所有预测同时开始 , 然后在每一步消除最小显着性的变量 。
这种建模技术的目的是使用最少的预测变量数来最大化预测能力 。 这也是处理高维数据集的方法之一 。
5. 岭回归(Ridge Regression)
岭回归分析是一种用于存在多重共线性(自变量高度相关)数据的技术 。 在多重共线性情况下 , 尽管最小二乘法(OLS)对每个变量很公平 , 但它们的差异很大 , 使得观测值偏移并远离真实值 。 岭回归通过给回归估计上增加一个偏差度 , 来降低标准误差 。
上面 , 我们看到了线性回归方程 。 还记得吗?它可以表示为:y=a+ b*x
这个方程也有一个误差项 。 完整的方程是:
y=a+b*x+e (error term), [error term is the value needed to correct for a prediction error between the observed and predicted value]
=> y=a+y= a+ b1x1+ b2x2+....+e, for multiple independent variables.
在一个线性方程中 , 预测误差可以分解为2个子分量 。 一个是偏差 , 一个是方差 。 预测错误可能会由这两个分量或者这两个中的任何一个造成 。 在这里 , 我们将讨论由方差所造成的有关误差 。
岭回归通过收缩参数λ(lambda)解决多重共线性问题 。 看下面的公式:
『技术』数据分析师必须掌握的7个回归分析方法
本文插图
在这个公式中 , 有两个组成部分 。 第一个是最小二乘项 , 另一个是β2(β-平方)的λ倍 , 其中β是相关系数 。 为了收缩参数把它添加到最小二乘项中以得到一个非常低的方差 。
要点:
除常数项以外 , 这种回归的假设与最小二乘回归类似;它收缩了相关系数的值 , 但没有达到零 , 这表明它没有特征选择功能 , 这是一个正则化方法 , 并且使用的是L2正则化 。
6. 套索回归(Lasso Regression)
它类似于岭回归 。 Lasso (Least Absolute Shrinkage and Selection Operator)也会惩罚回归系数的绝对值大小 。 此外 , 它能够减少变化程度并提高线性回归模型的精度 。 看看下面的公式:
『技术』数据分析师必须掌握的7个回归分析方法
本文插图
Lasso 回归与Ridge回归有一点不同 , 它使用的惩罚函数是绝对值 , 而不是平方 。 这导致惩罚(或等于约束估计的绝对值之和)值使一些参数估计结果等于零 。 使用惩罚值越大 , 进一步估计会使得缩小值趋近于零 。 这将导致我们要从给定的n个变量中选择变量 。
要点:
  • 除常数项以外 , 这种回归的假设与最小二乘回归类似
  • 它收缩系数接近零(等于零) , 确实有助于特征选择
  • 这是一个正则化方法 , 使用的是L1正则化
如果预测的一组变量是高度相关的 , Lasso 会选出其中一个变量并且将其它的收缩为零 。
7. 回归(ElasticNet)
ElasticNet是Lasso和Ridge回归技术的混合体 。 它使用L1来训练并且L2优先作为正则化矩阵 。 当有多个相关的特征时 , ElasticNet是很有用的 。 Lasso 会随机挑选他们其中的一个 , 而ElasticNet则会选择两个 。
『技术』数据分析师必须掌握的7个回归分析方法
本文插图
Lasso和Ridge之间的实际的优点是 , 它允许ElasticNet继承循环状态下Ridge的一些稳定性 。
要点: