『技术』数据分析师必须掌握的7个回归分析方法( 三 )
- 标准逐步回归法做两件事情 。 即增加和删除每个步骤所需的预测 。
- 向前选择法从模型中最显著的预测开始 , 然后为每一步添加变量 。
- 向后剔除法与模型的所有预测同时开始 , 然后在每一步消除最小显着性的变量 。
5. 岭回归(Ridge Regression)
岭回归分析是一种用于存在多重共线性(自变量高度相关)数据的技术 。 在多重共线性情况下 , 尽管最小二乘法(OLS)对每个变量很公平 , 但它们的差异很大 , 使得观测值偏移并远离真实值 。 岭回归通过给回归估计上增加一个偏差度 , 来降低标准误差 。
上面 , 我们看到了线性回归方程 。 还记得吗?它可以表示为:y=a+ b*x
这个方程也有一个误差项 。 完整的方程是:
y=a+b*x+e (error term), [error term is the value needed to correct for a prediction error between the observed and predicted value]
=> y=a+y= a+ b1x1+ b2x2+....+e, for multiple independent variables.
在一个线性方程中 , 预测误差可以分解为2个子分量 。 一个是偏差 , 一个是方差 。 预测错误可能会由这两个分量或者这两个中的任何一个造成 。 在这里 , 我们将讨论由方差所造成的有关误差 。
岭回归通过收缩参数λ(lambda)解决多重共线性问题 。 看下面的公式:
本文插图
在这个公式中 , 有两个组成部分 。 第一个是最小二乘项 , 另一个是β2(β-平方)的λ倍 , 其中β是相关系数 。 为了收缩参数把它添加到最小二乘项中以得到一个非常低的方差 。
要点:
除常数项以外 , 这种回归的假设与最小二乘回归类似;它收缩了相关系数的值 , 但没有达到零 , 这表明它没有特征选择功能 , 这是一个正则化方法 , 并且使用的是L2正则化 。
6. 套索回归(Lasso Regression)
它类似于岭回归 。 Lasso (Least Absolute Shrinkage and Selection Operator)也会惩罚回归系数的绝对值大小 。 此外 , 它能够减少变化程度并提高线性回归模型的精度 。 看看下面的公式:
本文插图
Lasso 回归与Ridge回归有一点不同 , 它使用的惩罚函数是绝对值 , 而不是平方 。 这导致惩罚(或等于约束估计的绝对值之和)值使一些参数估计结果等于零 。 使用惩罚值越大 , 进一步估计会使得缩小值趋近于零 。 这将导致我们要从给定的n个变量中选择变量 。
要点:
- 除常数项以外 , 这种回归的假设与最小二乘回归类似
- 它收缩系数接近零(等于零) , 确实有助于特征选择
- 这是一个正则化方法 , 使用的是L1正则化
7. 回归(ElasticNet)
ElasticNet是Lasso和Ridge回归技术的混合体 。 它使用L1来训练并且L2优先作为正则化矩阵 。 当有多个相关的特征时 , ElasticNet是很有用的 。 Lasso 会随机挑选他们其中的一个 , 而ElasticNet则会选择两个 。
本文插图
Lasso和Ridge之间的实际的优点是 , 它允许ElasticNet继承循环状态下Ridge的一些稳定性 。
要点:
- 在高度相关变量的情况下 , 它会产生群体效应
推荐阅读
- 「A1canton」智慧酒店震撼来袭——虚拟现实VR篇,五大技术革新传统酒店
- 「百度」百度发布直播搜索大数据:疫情下电商及知识类直播增速明显
- 「科技小数据」消费信贷的客户呈现出年轻化的趋势,新消费崛起
- 「北京头条客户端」科技部:将加大对前沿技术研发的攻关和支持力度
- 『财经涂鸦』三七互娱爆发的秘密:该用技术公司估值模型来看它了
- 2020年你应该关注的8大技术趋势,眺望曙光TVP线上技术闭门会纯享实录
- 十大突破性技术-NMN,叫你如何选择最好的NMN
- CNBC:京东智联云打造欧美企业在华首选技术服务平台
- 鲁信创投■60余家创投机构代表参加新能源与先进制造专场路演活动中国科协科学技术传播中心
- 产业气象站▲固守高端显示技术领先地位,三星、LGD皆弃LCD
