Spark中的RDD是什么,有哪些特性?

1).什么是RDD?

       弹式分布数据集(Resilient Distributed Dataset

2).RDD的五大特性?

       1.RDD是由一系列的partition组成的

       2.RDD之间具有依赖关系

       3.RDD作用在partition是上

       4.partition作用在具有(k,v)格式的数据集

       5.partition对外提供最佳计算位置,利于数据本地化的处理

3).Spark RDD需要注意的问题

       1.textFile方法底层封装的是读取方法和MR读取文件的方式一样,读取文件之前先split,默认split大小是一个block大小。

       2.RDD**实际上不存储数据(partition其实也不存储数据),

       3.什么是K,V格式的RDD?

              Ø 如果RDD里面存储的数据都是二元组对象,那么这个RDD我们就叫做K,V格式的RDD。

       4. 哪里体现RDD的弹性(容错)?

              Ø partition数量,可多可少,体现了RDD的弹性。

              Ø RDD之间具有依赖关系,可以基于上一个RDD重新计算出RDD。

       5.哪里体现RDD的分布式?

              Ø RDD是由Partition组成,partition是分布在不同节点上的。

你可能感兴趣的:(spark,spark,RDD)