大数据,数据挖掘与云计算的关系

我个人的理解和楼上几位有略微的不同,不一定对,参考一下吧~数据挖掘相关的方面我就不多做介绍了,看题主的描述应该是有认识的。那么重点就是大数据、云计算、以及他们之间的关系了。首先是大数据。我认为大数据与其说是详细的技术细节实现,倒不如说它首先是一个方法论,他的提出并不是开天辟地的大创造,而是对一种文体解法的总结,并把这类方法正式提出来作为解决现实问题的一种可行手段。然而光有方法是没用的,它必须要落地,必须要切实地在实际工作中能有产出,能看得见摸得着。那么与之对应地就有一大批完整的技术体系发展了起来,尤其是在开源社区的推动下,这种发展愈加迅猛。这一些技术包括什么呢?我稍微列举一下,排名不分前后:计算模型、计算引擎、运维、调度、虚拟化、存储等等。实际上这些东西没有一样是在这波浪潮中被新提出来的,在早先都已经有所成果,只是在特定的时间,他们的地位和角色得到了巨大的提升和整个社会的承认。于是,我们有了mapreduce、有了hadoop/spark/storm/,有了ganglia等运维系统,有诸如Yarn/mesos这样的调度系统,有docker这样性能极其出色的虚拟化工具,有了hdfs/hbase这样优秀的分布式存储容器。当他们被有机地组合在一起的时候,此时,就已经具备对大数据进行高性能处理的基本条件了。那么什么是云计算呢?我属于那种想要把分布式计算和云计算两个概念严格分开的那群人。我看到很多人提到云计算的时候想到的不是openstack、docker这些技术而是hadoop、spark这些,我觉得这两者还是应该区分一下的。曝光率最高的hadoop和spark等计算引擎,通常作为上述我提到的大数据技术链中的核心环节之一,因为他们直接或间接(比如加个hive)地暴露给用户进行使用,很多时候用户看到得最多。而他们最主要的任务是在于提供一种简单的方法,使开发者或者用户能够快速开发或生成出能够并行执行的应用。这样带来一个最大的好处在于,原本那些专注业务的算法专家们,可能并不是非常精通并行计算的方方面面,这种框架就帮助他们不需要太关心并行计算相关的实现,只需要调用接口就可以了。但是这就是云计算吗?来看看定义:云计算_百度百科 看百科就可以了。我认为云计算最大的几个特点在于资源按需使用,弹性分配,虚拟化等能力。它最大的几个作用就是,对于一个组织或集体来说,当有各种复杂应用运行在上面时,能够做到资源利用最大化,不同应用之间能够做到隔离互相不干扰。它将整个集群N台服务器的资源抽象成资源池,然后进行跨节点之间的分割。然后可以看到了,像hadoop/spark这样的系统,虽然后续通过一些附加插件或者组件也提供了类似的资源调度虚拟化这样的功能,但是他们本质,或者说是设计初衷,是为了计算,附加功能严格来说是在他们设计初衷的系统边界之外的。我相信通过我这些叙述,应该可以自行推出他们的关系了~
■网友
数据挖掘是分析工具的改进 大数据是数据源的拓展集成 云计算只是分析平台的改变
■网友
有一篇期刊文章讲到这部分的内容,《云计算环境下的数据挖掘应用》
【大数据,数据挖掘与云计算的关系】 三者的关系,我想用这一部分来描述:数据挖掘技术的主要问题是项目集合需要空间(大数据),并且项目级操作是巨大的。如果将数据挖掘应用于云计算环境,将会从云运营商那里按需租赁空间。这种方法解决了需要大量空间的问题。并且用户不再需要考虑空间大小,可直接使用数据挖掘技术。
关于三者起因的理解,我认为是:大量的网络应用和用户产生了存储规模巨大的数据(现在称之为大数据),而人们渐渐发现大量数据将产生的价值和意义,于是数据挖掘也随着大数据而兴起(以前就有,但现在谈的是兴起),而这过程中产生的计算问题,个人的电脑或者小单位的电脑已经难以处理,云计算顺势而生。
感兴趣的话,再继续往下看相关的介绍呗


推荐阅读