电商运营该怎样进行更有深度的数据分析而不是仅仅有漏斗模型,感觉一个模型不够用( 二 )


2. 回归
回归是研究自变量x对因变量y影响的一种数据分析方法。最简单的回归模型是一元线性回归(只包括一个自变量和一个因变量,且二者的关系可用一条直线近似表示),可以表示为Y=β0+β1x+ε,其中Y为因变量,x为自变量,β1为影响系数,β0为截距,ε为随机误差。
回归分析按照自变量的个数分为一元回归模型和多元回归模型;按照影响是否线性分为线性回归和非线性回归。
回归分析是广泛应用的统计学分析方法,可以用于分析其中一方对另一方的影响关系(通过自变量求因变量),也可以分析自变量对因变量的影响方向(正向影响还是负向影响)。回归分析的主要应用场景是进行预测和控制,例如计划制定、KPI制定、目标制定等方面,也可以基于预测的数据与实际数据进行比对和分析,确定事件发展程度并给未来行动提供方向性。
【电商运营该怎样进行更有深度的数据分析而不是仅仅有漏斗模型,感觉一个模型不够用】 3. 聚类
聚类是数据挖掘和计算中的基本任务,聚类是将大量数据集中具有“相似”特征的数据点划分为统一类别,并最终生成多个类的方法。聚类分析的基本思想是“物以类聚、人以群分”,因此大量的数据集中必然存在相似的数据点,基于这个假设就可以将数据区分出来,并发现每个数据集(分类)的特征。
聚类常用于数据探索或挖掘初期,在没有做数据整体分析之前进行的探索性分析,适用于样本量较大情况下的数据初步探索。比如针对企业整体用户特征,在未得到相关知识或经验之前先根据数据本身特点进行用户分群,然后再针对不同群体做进一步分析。
聚类析能解决的问题类型包括:目前的数据集可以分为几类、每个类别有多少样本量、不同类别中各个变量的强弱关系如何、不同类别的典型特征是什么等;同时,基于聚类可以对客户进行细分,在市场研究中的规模测试、机会发掘,以及进行图片压缩等应用。聚类无法提供明确的行动指向,聚类结果更多是为后期挖掘和分析工作提供参考,无法回答“为什么”和“怎么办”的问题。
4. 分类
分类算法通过对已知类别训练集的计算和分析,从中发现类别规则,以此预测新数据的类别的一类算法。分类算法是解决分类问题的方法,是数据挖掘、机器学习和模式识别中一个重要的研究领域。
分类的主要用途和场景是“预测”,基于已有的样本预测新的样本的所属类别。例如,信用评级、风险等级、欺诈预测等;它是模式识别的重要组成部分,例如机器翻译,人脸识别、医学诊断手写字符识别、指纹识别等图像识别领域,语音识别领域,视频识别领域等;另外,可以用于知识抽取,通过模型找到潜在的规律,帮助业务得到可执行的规则。
5. 关联
关联规则学习通过寻找最能够解释数据变量之间关系的规则,来找出大量多元数据集中有用的关联规则,它是从大量数据中发现多种数据之间关系的一种方法,另外,它还可以基于时间序列对多种数据间的关系进行挖掘。关联分析的典型案例是“啤酒和尿布”的捆绑销售,即买了尿布的用户还会一起买啤酒。
关联规则相对其他数据挖掘模型简单,易于业务理解和应用。关联模型的典型应用场景是购物篮分析,通过分析用户同时购买了哪些商品来分析用户购物习惯。这种策略还会应用于捆绑销售、商品促销设计、页面促销设计、商品陈列设计、商品价格策略和基于购买的用户特征分析等。网站分析工具Webtrekk中的关联分析报表即应用了关联模型。
关联模型广泛应用于购物篮分析、网站页面浏览分析、广告流量来源分析、用户关键字搜索分析、网站内容或产品查看分析、生物特征提取、DNA序列破译、自然灾害预测、科学实验分析等,回答的问题类似于“发生了A之后,还会发生B还是C?”或者“通常A和B还是和C一起发生”?
6. 时间序列
时间序列是用来研究数据随时间变化趋势而变化的一类算法,它是一种常用的回归预测方法。它的原理是事物的连续性,所谓连续性是指客观事物的发展具有合乎规律的连续性,事物发展是按照它本身固有的规律进行的。在一定条件下,只要规律赖以发生作用的条件不产生质的变化,则事物的基本发展趋势在未来就还会延续下去。


推荐阅读