大数据怎样在企业落地( 三 )


价值1:大数据使“精细刻画”变成了可能。
精细刻画指用很多特征来描述一种关系。因为如果收集到的样本量很少,就无法用较多的特征来细分样本。因为落到每个细分格子中的样本数过少使统计结论不置信,如“海淀区西二旗6~10岁的女童喜欢男性旅游鞋”的结论。虽然该结论很荒谬,但这种细致描述的方法还是很有价值的。市场细分意味着差异化需求,其中隐藏了巨大的商机。如果能够获取足够大的样本量,可以支撑更细致的结论,而不用担心置信性。
这是“大数据”的第一个价值:有了“大数据”,一切统计模型都变得极其个性化。
如医疗领域的场景,当医生遇到新病人时,一方面根据自己所学的理论知识进行分析,另一方面也会和以往接触过的病例进行比对。如果之前遇见过与新病人很像的病例,当时的治疗方案已经被印证效果良好,医生会给出相近的诊疗方案。但每个医生见过的病例是有限的。如果找不到完全一致的病例,就只能参考一些部分相似的病例,诊疗方案效果大概率会打折扣。这也是老中医比年轻中医受欢迎、一线城市的知名医院比小城市的医院更受欢迎的原因之一,因为前者经历过更多的病例。大数据的价值类似于收集到足够多的病例,对于每一个病人,均可以找到数量众多的相似病例,那么对新病人的病情分析和治疗方案会准确、有效得多。
很多互联网企业都在业务中使用这样细致刻画的模型,比如搜索引擎的广告点击率预估、电商网站的推荐系统等等,这些模型将一次查询或一次推荐的场景刻画的非常细致,甚至用成千上万维度的特征来描述规律(如:买了某本书并团购了某场电影票的年轻女性高概率会购买某件商品)。这种精细的刻画没有大数据的支持几乎是不可能的,没有大数据我们只能得到“女性喜欢A,男性喜好B”这样很粗略的统计规律。
大样本使大特征成为可能,大特征使大样本发挥价值。——大数据时代
大数据使得“统计科学”的重心发生了变化。经典统计学更多探讨“如何从抽样的个体样本推断整体数据的统计结论”;而大数据时代,讨论的主题则是“如何寻找合适的维度切分整体数据,以便更好的推断个体行为”。
价值2:大数据使“智能学习”变成可能人类基于观测数据探索世间规律,共经历了四个阶段:
阶段1 规律=全部领域知识(用数学公式表示),数据用于启发思路和验证假说:科学家根据观察到的现象提出假说(表达规律的数学公式),然后收集实验数据来验证假说。
典型如牛顿第二定律F=ma,物体的加速度与所受外力正比,与物体质量成反比。在生活中时有体会,推动一个物体,使用的力气越大,它的加速越快;该物体越沉重(需排除摩擦力的干扰),它加速的越慢。相信大家对中学含有小车、砝码与滑轮的物理实验记忆犹新。这个阶段,数据在人类学习的过程中,主要起“启发科学家设计假说的思路”和“验证假说有效性”的作用。
阶段2 规律=大部分领域知识+小部分统计学习:人类将某个领域的知识梳理清楚,留下小部分内容交给机器基于数据来学习。
典型如自然语言处理(NLP)中的语法解析,首先由人类总结出语法规则,根据语法规则解析某句话,如“he drive down the street in the car“,这句话既可以解析成“他开车穿过街道”,也可以解析成“他穿过车里的街道”,两种方式均满足语法规则)。但前者是人类在该语境中习惯的表达方法,而后者则不是。哪个解析结果更符合语境,可以交由机器解决,它通过语料库(大量资料、文献、对话的文本记录),判断前者出现(被使用)的概率更高。最终,人类总结的语法规则和机器在语法规则上建立的统计模型一起完成了语法解析的任务。
阶段3 规律=小部分领域知识+大部分统计学习:机器学习越来越智能,越来越多的领域知识不再需要人类梳理和总结,而可以通过机器自动学到。
典型如近些年火热的深度学习模型,进一步减少了机器学习对领域知识的依赖。在图像处理的人脸识别问题中,通过深层次的神经网络,可以自动学习出从像素到边界、从边界到部位、再从部位到人脸的深层次图像内涵,不再依赖人类的梳理总结。但网络结构的设计和非线性变换的函数,依然需要人类基于图像处理领域的特点去设定,所以不能说全部脱离领域知识。


推荐阅读