hadoop中的mapreduce链接(mapreduce chaining)怎样避免中间文件的产生

用Spark可以实现流水化处理,但碰到有shuffle的操作过程也无能为力。
■网友
以前碰过类似这样处理reducer的想法被学长枪了hadoop是无法控制这样的所以你老板的建议是对的 是要分job要说方法嘛 有个猜想 (但不了解具体算法 所以只能是猜想mapper直接就做了reducer工作 可以的话最后再汇总到一台reducermapper分担部分工作 其余工作看能不能通过自己code partition或者combination类似的控制流程中的行为来达到目的愚见或者试下spark?感觉各种厉害 不过我不太懂 有机会也想接触下 用hadoop 因为有些使用情景 有些job分m和r实在太难 或者需要分job的类似题主 也是蛋疼如此。


    推荐阅读