Hadoop与Spark两个大数据技术生态系统大PK
hadoop和Spark是两种不同的大数据处理框架,他们的组件都非常多,往往也不容易学,我把他们两者整理在一幅图中,给大家一个全貌的感觉。至于各组件的详细介绍、相关联系和区别,以及它们在大数据平台建设中的具体实施关注点,待点赞数达到1000,我再对帖子进行详细的更新,请大家随手帮忙点个赞。
以上这些大数据组件是日常大数据工作中经常会碰到的,每个组件大概的功能,我已经在图中做了标识。下面,针对这幅图我给大家两点重要提示:
a.蓝色部分,是Hadoop生态系统组件,黄色部分是Spark生态组件,虽然他们是两种不同的大数据处理框架,但它们不是互斥的,Spark与hadoop 中的MapReduce是一种相互共生的关系。Hadoop提供了Spark许多没有的功能,比如分布式文件系统,而Spark 提供了实时内存计算,速度非常快。有一点大家要注意,Spark并不是一定要依附于Hadoop才能生存,除了Hadoop的HDFS,还可以基于其他的云平台,当然啦,大家一致认为Spark与Hadoop配合默契最好摆了。
b.技术趋势:Spark在崛起,hadoop和Storm中的一些组件在消退。大家在学习使用相关技术的时候,记得与时俱进掌握好新的趋势、新的替代技术,以保持自己的职业竞争力。
HSQL未来可能会被Spark SQL替代,现在很多企业都是HIVE SQL和Spark SQL两种工具共存,当Spark SQL逐步成熟的时候,就有可能替换HSQL;
MapReduce也有可能被Spark 替换,趋势是这样,但目前Spark还不够成熟稳定,还有比较长的路要走;
Hadoop中的算法库Mahout正被Spark中的算法库MLib所替代,为了不落后,大家注意去学习Mlib算法库;
Storm会被Spark Streaming替换吗?在这里,Storm虽然不是hadoop生态中的一员,但我仍然想把它放在一起做过比较。由于Spark和hadoop天衣无缝的结合,Spark在逐步的走向成熟和稳定,其生态组件也在逐步的完善,是冉冉升起的新星,我相信Storm会逐步被挤压而走向衰退。
【Hadoop与Spark两个大数据技术生态系统大PK】 欢迎大家关注我的专栏“大数据实践与职业生涯”并留言,专栏会陆续的推出过往十多年的大数据工作经验总结和我的一些研究实践成果。如果你是大数据新人,或者想转行进入大数据领域,或者大数据职业生涯上存在一些疑惑,都欢迎关注我的live分享“大数据人的职业生涯规划” 、 “数据分析师-从零入门到精通”、“大数据人的数据科学家之路”。
推荐阅读
- 『大中城市』江苏4市2涨2跌 70个大中城市11月房价报告出炉
- hadoop中的mapreduce链接(mapreduce chaining)怎样避免中间文件的产生
- 上海或苏州有没有比较好的大数据培训机构
- 这个大叔太暖了!高校保安连续14天接送骨折女生上课
- 汽车知识|高压水枪别乱用! 洗车别掉进这12个大坑
- 车聚网|突然觉得,华为的“自动驾驶技术”是一个大泡泡?|聚论
- 请问一个大学生怎样有计划的成为一名数据分析师
- |宿豫一辆小小电动三轮车成“客车” 载3个大人5个孩子
- 小小三轮车载了8个人,3个大人5个小孩
- 我是个大一的大学生,过了这个暑假就大二了,专业是学会计的,暑假在家感觉想学点技能,不知道有没啥推荐
