余温|维度爆炸?Python实现数据压缩如此简单( 三 )


plt.figure(figsize=(10, 8))
# 基础散点图
x, y = results['经济总量水平'], results['人均水平']
label = results['area']
plt.scatter(x, y)
plt.xlabel('经济总量水平'); plt.ylabel('人均水平')
# 对散点图中的每一个点进行文字标注
## 固定代码 , 无需深究 , 拿来即用
## 给点标注是需要将 x 和 y 以及标签如上段代码那样单独拆开
for a,b,l in zip(x,y,label):
plt.text(a, b+0.1, '%s.' % l, ha='center', va='bottom', fontsize=14)
# 添加两条竖线
plt.vlines(x=results['经济总量水平'].mean,
ymin=-1.5, ymax=3, colors='red')
plt.hlines(y=results['人均水平'].mean,
xmin=-4, xmax=6, colors='red')

余温|维度爆炸?Python实现数据压缩如此简单最终从上图可以看出:

  • 广西 , 河北 , 福建三地的人均水平和经济总量水平都偏低
  • 上海的人均经济水平很高 , 但经济总量水平缺只是略优于均值
  • 广东的人均经济水平稍次于均值 , 但经济总量水平很高
  • ......

余温|维度爆炸?Python实现数据压缩如此简单小结本文讲解了基于主成分分析的样本特征描述 , 并使用Python示范了完整的流程 。 其中 , 也对由多个自变量生成的主成分的命名描述操作中需要注意的点作了比较详细的说明 。 其实PCA并不能非常好的满足维度分析的需求 , 能够做到「因子分析」最好 , 它是主成分方法的拓展 , 作为维度分析的手段 , 因子分析也是构造合理的聚类模型和稳健的分类模型的必然步骤 。
Python商业数据挖掘自动化系列代码及数据已经上传GitHub , 如有需要可以自行下载:「商业数据分析实战」 。
余温|维度爆炸?Python实现数据压缩如此简单


推荐阅读