『』如何使用Pandas-Profiling进行快速探索性数据分析( 二 )
本文插图
对于数值特征 , 除了有均值、标准差、最小值、最大值、四分位距(IQR)等详细统计外 , 还绘制了直方图 , 给出了常用值和极值的列表 。
分类特征:
与数字特征类似 , 对于分类特征 , 它会计算通用值 , 长度 , 字符等 。
本文插图
交互
在交互部分 , pandas_profiling库自动为每一对变量生成交互图 。 您可以通过从两个标题中选择特定的变量来获取任何一对的交互关系图 。
本文插图
相关矩阵:
相关性是一种统计技术 , 它可以显示变量对之间是否相关以及如何相关 。
相关的主要结果称为相关系数(或“r”) 。 它的范围是从-1.0到+1.0 。 r越接近+1(或-1) , 这两个变量的关系就越密切 。 如果r接近0 , 这意味着变量之间不相关 。 如果r是正的 , 这意味着一个变量变大 , 另一个变大 。 如果r是负的 , 这意味着随着一个变大 , 另一个变小(通常称为“逆相关”) 。
在生成所有数值特征的相关矩阵时 , pandas_profiling库为我们提供了所有流行的选项 , 包括Pearson的r , Spearman的ρ等 。
本文插图
缺点
pandas-profiling的主要缺点是针对大型机器学习数据集 。 随着数据量的增加 , 生成报告的时间也增加了很多 。
解决此问题的一种方法是为数据集的一部分生成概要报告 。 但是在执行此操作时 , 确保对数据进行随机采样非常重要 , 这样它才能代表我们拥有的所有数据 。 我们可以这样做:
from pandas_profiling import ProfileReport # Generate report for 10000 data points profile = ProfileReport(data.sample(n = 10000), title=''Titanic Data set'', html={'style': {'full_width': True}}, sort=''None'') # save to file profile.to_file(output_file='10000datapoints.html')【『』如何使用Pandas-Profiling进行快速探索性数据分析】如果您坚持要获得关于整个数据集的报告 , 您可以使用最小模式来实现这一点 。 在最小模式下 , 生成的简化报告比完整报告的信息要少 , 但对于大型数据集 , 生成的速度相对较快 。 简化报告的代码如下:
profile = ProfileReport(large_dataset, minimal=True) profile.to_file(output_file=''output.html'')
推荐阅读
- 海峡生活汇印度对中国虎视眈眈,我国将如何迎接挑战,英国仍想着事后清算
- JEECG前端Chrome调试小技巧汇总
- 嘴强玩家马小跳如何才能绝地翻盘?萨满:简单,炉石传说:对手场上7个死亡之翼
- 购房置业▲社保未缴满15年如何补救,这4种方式都可以,劝你不要选第4个
- #青春有你第二季#青你2学员问杨天真“火了如何调整心态”,杨天真怒怼:等你火了再说吧
- 程程搞笑该如何废物利用,网友回答笑了,在家找到过期的洗面奶
- 崔元新不输当前5G新机的4款旧旗舰,你如何选择呢?,新一轮降价潮
- IT数码通你现在使用哪款手机?你是否支持国产手机?
- 炒米视角对国家没用”,此人如何评价?,王福重博士谈农民:“一身蛮力
- 讲故事的女人是如何对待她们的?说出来你绝对不敢相信,萨达姆俘虏美国女兵后
