intersection

用来找到两个rdd的交集,注意,最终的new rdd的分区数量取决于两个rdd中的最大分区数量。

测试一下:

val data1 = sc.parallelize(1 to 20,1)

val data2 = sc.parallelize(1 to 5,2)

val data3 = data1.intersection(data2)

data3.partitions.length

data3.collect

输出结果是1,2,3,4,5

data3的分区数量是2

你可能感兴趣的:(intersect)