『技术』数据分析师必须掌握的7个回归分析方法( 二 )

  • 自变量与因变量之间必须有线性关系
  • 多元回归存在多重共线性 , 自相关性和异方差性
  • 【『技术』数据分析师必须掌握的7个回归分析方法】线性回归对异常值非常敏感 。 它会严重影响回归线 , 最终影响预测值
多重共线性会增加系数估计值的方差 , 使得在模型轻微变化下 , 估计非常敏感 。 结果就是系数估计值不稳定 , 在多个自变量的情况下 , 我们可以使用向前选择法 , 向后剔除法和逐步筛选法来选择最重要的自变量 。
2. 逻辑回归(Logistic Regression)
逻辑回归是用来计算“事件=Success”和“事件=Failure”的概率 。 当因变量的类型属于二元(1 / 0 , 真/假 , 是/否)变量时 , 我们就应该使用逻辑回归 。 这里 , Y的值从0到1 , 它可以用下方程表示 。
odds= p/ (1-p) = probability of event occurrence / probability of not event occurrence
ln(odds) = ln(p/(1-p))
logit(p) = ln(p/(1-p)) = b0+b1X1+b2X2+b3X3....+bkXk
上述式子中 , p表述具有某个特征的概率 。 你应该会问这样一个问题:我们为什么要在公式中使用对数log呢?
因为在这里我们使用的是的二项分布(因变量) , 我们需要选择一个对于这个分布最佳的连结函数 。 它就是Logit函数 。 在上述方程中 , 通过观测样本的极大似然估计值来选择参数 , 而不是最小化平方和误差(如在普通回归使用的) 。
『技术』数据分析师必须掌握的7个回归分析方法
本文插图
要点:
  • 它广泛的用于分类问题 。
  • 逻辑回归不要求自变量和因变量是线性关系 。 它可以处理各种类型的关系 , 因为它对预测的相对风险指数OR使用了一个非线性的log转换 。
为了避免过拟合和欠拟合 , 我们应该包括所有重要的变量 。 有一个很好的方法来确保这种情况 , 就是使用逐步筛选方法来估计逻辑回归 。 它需要大的样本量 , 因为在样本数量较少的情况下 , 极大似然估计的效果比普通的最小二乘法差 。
自变量不应该相互关联的 , 即不具有多重共线性 。 然而 , 在分析和建模中 , 我们可以选择包含分类变量相互作用的影响 。
  • 如果因变量的值是定序变量 , 则称它为序逻辑回归
  • 如果因变量是多类的话 , 则称它为多元逻辑回归
3. 多项式回归(Polynomial Regression)
对于一个回归方程 , 如果自变量的指数大于1 , 那么它就是多项式回归方程 。 如下方程所示:y=a+b*x^2
在这种回归技术中 , 最佳拟合线不是直线 。 而是一个用于拟合数据点的曲线 。
『技术』数据分析师必须掌握的7个回归分析方法
本文插图
重点:
虽然会有一个诱导可以拟合一个高次多项式并得到较低的错误 , 但这可能会导致过拟合 。 你需要经常画出关系图来查看拟合情况 , 并且专注于保证拟合合理 , 既没有过拟合又没有欠拟合 。 下面是一个图例 , 可以帮助理解:

『技术』数据分析师必须掌握的7个回归分析方法
本文插图
明显地向两端寻找曲线点 , 看看这些形状和趋势是否有意义 。 更高次的多项式最后可能产生怪异的推断结果 。
4. 逐步回归(Stepwise Regression)
在处理多个自变量时 , 我们可以使用这种形式的回归 。 在这种技术中 , 自变量的选择是在一个自动的过程中完成的 , 其中包括非人为操作 。
这一壮举是通过观察统计的值 , 如R-square , t-stats和AIC指标 , 来识别重要的变量 。 逐步回归通过同时添加/删除基于指定标准的协变量来拟合模型 。 下面列出了一些最常用的逐步回归方法:


推荐阅读