hadoop中的mapreduce链接(mapreduce chaining)怎样避免中间文件的产生
用Spark可以实现流水化处理,但碰到有shuffle的操作过程也无能为力。
■网友
以前碰过类似这样处理reducer的想法被学长枪了hadoop是无法控制这样的所以你老板的建议是对的 是要分job要说方法嘛 有个猜想 (但不了解具体算法 所以只能是猜想mapper直接就做了reducer工作 可以的话最后再汇总到一台reducermapper分担部分工作 其余工作看能不能通过自己code partition或者combination类似的控制流程中的行为来达到目的愚见或者试下spark?感觉各种厉害 不过我不太懂 有机会也想接触下 用hadoop 因为有些使用情景 有些job分m和r实在太难 或者需要分job的类似题主 也是蛋疼如此。
推荐阅读
- 鄂温克冬季马赛-30℃极寒开赛:寒冬中的火热派对
- 大雪@大雪腌肉 适当进补 今日大雪
- |电商事业中的“闪光少年”
- 经观汽车|日系车企中的“异类”?东风日产将导入e-POWER技术大干增程式混动 | 经观汽车
- 中年|这些东西,比你想象中的还要大得多!
- 请问杨毅微博中的这两人是谁
- 某些公司招聘要求中的精通mysql是啥程度
- 宝宝|婴幼儿游泳——宝宝人生中的第一健身运动
- 汽车|你眼中的未来出行世界——YiMagazine x 道达尔
- 有必要把手中的iPhone 6s plus 64G的卖掉买小米MiX吗
