用sklearn的逻辑回归做二分类问题,发现是否标准化对结果的准确率和回归率影响很大

我怀疑是因为在未归一化时,损失函数的谷底太窄,给优化造成了困难,所以还没有找到最优解就收敛了。

■网友
泻药。无论用哪种机器学习方法,先对数据做标准化是默认的要求

■网友
发下代码吧,不发怎么判断问题?
■网友
跟你的测试数据初始值有关。
当你把数据投放到模型里去计算损失的时候,由于小数以及大数的乘法的关系,误差有可能会被分布到不同的等高线上。想象一个太阳系,有的误差被分布到水星的轨道,有的分布到冥王星的轨道上,这样的分布是极其不均匀的。当我们用梯度下降法作收殓的时候,在不同等高线上的误差,他的收敛情况是不一样的,有可能有的数据已经到了太阳(最优)了,但有的仅仅到达土星这个位置。这样一来,就很有可能出现有的误差永远收敛不到最优点上面。也就是说,如果你的数据一开始是不均匀的,那么,通过模型的计算,误差有可能变得更加不均匀。反过来,如果你运气好,数据一开始就分布得比较均匀,那么,模型计算之后,误差就分布到差不多的等高线上,这样就能得到一致收敛。要阻止这种不均匀,标准化是方法之一。
【用sklearn的逻辑回归做二分类问题,发现是否标准化对结果的准确率和回归率影响很大】 以上答案使用讯飞语音输入法作答,如有错别字,敬请谅解!


    推荐阅读