用来找到两个rdd的交集,注意,最终的new rdd的分区数量取决于两个rdd中的最大分区数量。
测试一下:
val data1 = sc.parallelize(1 to 20,1) val data2 = sc.parallelize(1 to 5,2) val data3 = data1.intersection(data2) data3.partitions.length data3.collect
输出结果是1,2,3,4,5
data3的分区数量是2
时间: 2024-09-17 17:03:40