怎样自己找数据分析项目来做?( 三 )


所以利用这些数据,我们可以做的事情包括:量化指标\u0026amp;简单预测+可视化输出
看了一下网上优秀的答辩案例,整理了一份可视化分析框架,有兴趣的同学可以动手开始做了~~
怎样自己找数据分析项目来做?

天池-aribnb短租数据集分析赛链接:https://tianchi.aliyun.com/competition/entrance/231715/introduction?spm=5176.12281973.1005.9.3dd54c2ai3uqkT
因为自己在工作中会处理许多酒店相关的数据,在看见这个数据集的时候,有种莫名的熟悉感。
数据分为汇总版和明细版两类。可从汇总版入手熟悉后,进阶使用完整版挖掘更多信息。
listings 数据为短租房源基础信息,包括房源、房东、位置、类型、价格、评论数量和可租时间等等。
calendar 数据为短租房源时间表信息,包括房源、时间、是否可租、租金和可租天数等等。
reviews 数据为短租房源的评论信息。汇总版中仅包括房源 listing_id和评论日期,用来时间序列和数据可视化分析。明细版还包括评论相关的内容和作者信息。
neighbourhoods 数据为北京的行政区划。
那如何用这份数据集来体现数据分析的能力呢?我主要想到了以下可以做的事情:
【1】 计算房东的质量分数,实现房东的精细化运营管理
我们可以量化房东旗下房源数量,房源位置,房源价格,可租天数、房源评价等信息,为房东计算质量分数。有了这个质量分数,airbnb能够有针对性的维护高质量房东,为他们提供佣金折扣以及各种福利待遇;也能够惩罚低质量房东,督促房东改进房源,提升平台的整理质量。
【2】 同理,也可以通过对房源信息进行量化,挖掘最受用户欢迎的房源
比如我们可能发现,整屋出租更受客户的欢迎;市中心西边地段9比市中心东边地段3的房源更受客户欢迎……通过对房源的地理位置,类型,最小供应天数,价格等数据进行量化建模,得到房源的欢迎度评分。可以指导airbnb和房东更有针对性的运营房源资源。
【3】 向客户推荐各个地区“最便宜”、“最精致”、“最小资”、“最有性价比”……的房源
Kaggle – hotel booking demand链接:https://www.kaggle.com/jessemostipak/hotel-booking-demand
我可能对酒店数据有偏好……
这份赛题提供的数据集,数据集里包括了城市酒店和度假酒店的预定维度数据,例如预定时间,停留时间,成人/儿童/婴儿数量,早餐,停车位等等。
不仅可以做酒店预订的预测,也可以做出一份用户预定酒店的行为分析。
在大脑里构想了一下,没有比赛的压力,没有排名的限定,完全可以用这份数据做出一份简易版本《酒店出行偏好分析报告》。
在分析报告的PPT里,可以展示用户提前预定时长偏好、餐饮偏好、预定时间(月份)偏好、用户出行结构、酒店类型偏好等维度的数据。
不过缺点就是数据集脱离了实际需求场景。针对以上分析出来的行为偏好,我们都需要自己做进一步的思考——数据能够为业务带来什么建议,想到这一层,才能够足够自信的在面试过程中展示自己的工作。
其实不论是天池还是kaggle,都为我们提供了丰富的数据集。但并不是所有的数据集都适合我们拿来练手作为项目经历的补充,绝大多数的数据集都是偏向于算法优化的,这就导致数据集本身的数据字段不一定能够挖掘出和很多业务思想相关的东西。
数据分析和算法的区别之一就在于,以算法岗为求职目标的同学在看见数据集的时候,脑子里想到的一定是“我要怎么做才能让模型预测的更好?”;而以数分(商分)为求职目标的同学在看见数据集的时候,应该去判断“这些数据对我优化业务管理有什么帮助?”
其实没有数分相关的实习或者项目经历并不可怕,花上1个月的时间,投入120%的精力选择一个数据集琢磨,体验“数据清洗-\u0026gt;数据探索-\u0026gt;数据建模(数据可视化)-\u0026gt;输出结论”的过程,技巧性的总结成项目文档,一定能有所收获。甚至在面试的过程中,自己探索数据集的经历,能够成为你的亮点项目。


推荐阅读