MapReduce实现join操作

计算模型

整个计算过程是:
(1)在map阶段,把所有记录标记成的形式,其中key是id,value则根据来源不同取不同的形式:来源于表A的记录,value的值为"a#"+name;来源于表B的记录,value的值为"b#"+score。
(2)在reduce阶段,先把每个key下的value列表拆分为分别来自表A和表B的两部分,分别放入两个向量中。然后遍历两个向量做笛卡尔积,形成一条条最终结果。
如下图所示:

http://blog.sina.com.cn/s/blog_66474b160101gdop.html

http://blog.csdn.net/leoleocmm/article/details/8602081


https://github.com/julycoding/The-Art-Of-Programming-By-July

你可能感兴趣的:(MapReduce实现join操作)