Spark(第五节) RDD、DataFrame、DataSet的介绍与比较,创建DataFrame和DataSet,三者之间互相转换,scala代码创建和使用DataFram

目录

  • RDD、DataFrame、DataSet的介绍与比较
    • 概述
    • RDD基本介绍
    • Dataframe基本概述
    • Dataset基本概述
    • 三者的共性
    • 三者的区别
  • 创建DataFrame
    • 读取文本文件创建DataFrame
      • 第一种方式:通过RDD配合case class进行转换DF
      • 第二种方式:通过sparkSession构建DataFrame
    • 读取json文件创建DataFrame
    • 读取parquet列式存储格式文件创建DataFrame
  • 创建DataSet
    • 第一种方式创建DataSet
    • 第二种方式创建DataSet
    • 第三种方式创建DataSet
  • spark DataFrame常见操作
  • RDD、DataFrame、DataSet之间互相转换
    • DataFrame与DataSet互相转换
    • DataFrame和DataSet互相转换
    • RDD和DataSet互相转换
    • RDD和DataFrame互相转换
  • scala代码创建和使用DataFram
    • 第一种方式创建DF:通过RDD配合样例类创建
    • 第二种方式创建DF:通过StructType配合Row直接创建

RDD、DataFrame、DataSet的介绍与比较

概述

Spark(第五节) RDD、DataFrame、DataSet的介绍与比较,创建DataFrame和DataSet,三者之间互相转换,scala代码创建和使用DataFram_第1张图片
在sparkSQL当中,spark为我们提供了两个操作sparkSQL的抽象,分别是DataFrame和DataSet。也就是说我们操作sparkSQL一般都是使用DataFrame或者DataSet来实现的,就类似于我们SparkCore模块当中,我们的抽象是RDD,我们使用SparkContext来实现操作RDD一样。
对于在版本上面,spark也有一些历史变动
RDD(Spark1.0) ==> DataFrame(1.3) ==> DataSet(1.6)
如果同样的数据都给到这三个数据结构,他们分别计算后,都会出相同的计算结果,只不过执行速度和执行效率不太一样。
在后期的spark发布版本当中,DataSet会逐步的取代RDD和DataFrame成为spark的唯一API接口。

RDD基本介绍

  • RDD是一个懒执行的不可变的可以支持Lambda表达式的并行数据集合。
  • RDD的最大好处就是简单,API的人性化程度很高。
  • RDD的劣势是性能限制,它是一个JVM驻内存对象,这也就决定了存在GC的限制和数据增加时Java序列化成本的升高。

Dataframe基本概述

与RDD类似,DataFrame也是一个分布式数据容器。然而DataFrame更像传统数据库的二维表格,除了数据以外,还记录数据的结构信息,即schema。同时,与Hive类似,DataFrame也支持嵌套数据类型(struct、array和map)。从API易用性的角度上看,DataFrame API提供的是一套高层的关系操作,比函数式的RDD API要更加友好,门槛更低。由于与R和Pandas的DataFrame类似,Spark DataFrame很好地继承了传统单机数据分析的开发体验。
Spark(第五节) RDD、DataFrame、DataSet的介绍与比较,创建DataFrame和DataSet,三者之间互相转换,scala代码创建和使用DataFram_第2张图片
上图直观地体现了DataFrame和RDD的区别。左侧的RDD[Person]虽然以Person为类型参数,但Spark框架本身不了解Person类的内部结构。而右侧的DataFrame却提供了详细的结构信息,使得Spark SQL可以清楚地知道该数据集中包含哪些列,每列的名称和类型各是什么。DataFrame多了数据的结构信息,即schema。RDD是分布式的Java对象的集合。DataFrame是分布式的Row对象的集合。DataFrame除了提供了比RDD更丰富的算子以外,更重要的特点是提升执行效率、减少数据读取以及执行计划的优化,比如filter下推、裁剪等。
DataFrame是为数据提供了Schema的视图。可以把它当做数据库中的一张表来对待
DataFrame也是懒执行的。
性能上比RDD要高,主要有两方面原因:

  • 定制化内存管理
  • 数据以二进制的方式存在于非堆内存,节省了大量空间之外,还摆脱了GC的限制。

Dataset基本概述

  1. 是Dataframe API的一个扩展,是Spark最新的数据抽象
  2. 用户友好的API风格,既具有类型安全检查也具有Dataframe的查询优化特性。
  3. Dataset支持编解码器,当需要访问非堆上的数据时可以避免反序列化整个对象,提高了效率。
  4. 样例类被用来在Dataset中定义数据的结构信息,样例类中每个属性的名称直接映射到DataSet中的字段名称。
  5. Dataframe是Dataset的特列,DataFrame=Dataset[Row] ,所以可以通过as方法将Dataframe转换为Dataset。Row是一个类型,跟Car、Person这些的类型一样,所有的表结构信息我都用Row来表示。
  6. DataSet是强类型的。比如可以有Dataset[Car],Dataset[Person].
    DataFrame只是知道字段,但是不知道字段的类型,所以在执行这些操作的时候是没办法在编译的时候检查是否类型失败的,比如你可以对一个String进行减法操作,在执行的时候才报错,而DataSet不仅仅知道字段,而且知道字段类型,所以有更严格的错误检查。就跟JSON对象和类对象之间的类比。

RDD让我们能够决定怎么做,而DataFrame和DataSet让我们决定做什么,控制的粒度不一样。
Spark(第五节) RDD、DataFrame、DataSet的介绍与比较,创建DataFrame和DataSet,三者之间互相转换,scala代码创建和使用DataFram_第3张图片

三者的共性

  1. RDD、DataFrame、Dataset全都是spark平台下的分布式弹性数据集,为处理超大型数据提供便利。
  2. 三者都有惰性机制,在进行创建、转换,如map方法时,不会立即执行,只有在遇到Action如foreach时,三者才会开始遍历运算,极端情况下,如果代码里面有创建、转换,但是后面没有在Action中使用对应的结果,在执行时会被直接跳过。
val sparkconf = new SparkConf().setMaster("local").setAppName("test").set("spark.port.maxRetries","1000")
val spark = SparkSession.builder().config(sparkconf).getOrCreate()
val rdd=spark.sparkContext.parallelize(Seq(("a", 1), ("b", 1), ("a", 1)))
// map不运行
rdd.map{
   line=>
  println("运行")
  line._1
}
  1. 三者都会根据spark的内存情况自动缓存运算,这样即使数据量很大,也不用担心会内存溢出
  2. 三者都有partition的概念
  3. 三者有许多共同的函数,如filter,排序等
  4. 在对DataFrame和Dataset进行操作许多操作都需要这个包进行支持,import spark.implicits._
  5. DataFrame和Dataset均可使用模式匹配获取各个字段的值和类型,如下:

DataFrame:

testDF.map{
   
      case Row(col1:String,col2:Int)=>
        println(col1);println(col2)
        col1
      case _=>
        ""
    }

Dataset:

case class Coltest(col1:String,col2:Int)extends Serializable //定义字段名和类型
    testDS.map{
   
      case Coltest(col1:String,col2:Int)=>
        println(col1);println(col2)
        col1
      case _=>
        ""
    }

三者的区别

RDD:
1、RDD一般和spark mlib同时使用。
2、RDD不支持sparksql操作。
DataFrame:
1、与RDD和Dataset不同,DataFrame每一行的类型固定为Row,只有通过解析才能获取各个字段的值,每一列的值没法直接访问。
2、DataFrame与Dataset一般不与spark ml同时使用。
3、DataFrame与Dataset均支持sparksql的操作,比如select,groupby之类,还能注册临时表/视窗,进行sql语句操作。
4、DataFrame与Dataset支持一些特别方便的保存方式,比如保存成csv,可以带上表头,这样每一列的字段名一目了然,利用这样的保存方式,可以方便的获得字段名和列的对应,而且分隔符(delimiter)可以自由指定。
Dataset:
Dataset和DataFrame拥有完全相同的成员函数,区别只是每一行的数据类型不同。
DataFrame也可以叫Dataset[Row],每一行的类型是Row,不解析,每一行究竟有哪些字段,各个字段又是什么类型都无从得知,只能用上面提到的getAS方法或者共性中的第七条提到的模式匹配拿出特定字段,而Dataset中,每一行是什么类型是不一定的,在自定义了case class之后可以很自由的获得每一行的信息。
可以看出,Dataset在需要访问列中的某个字段时是非常方便的,然而,如果要写一些适配性很强的函数时,如果使用Dataset,行的类型又不确定,可能是各种case class,无法实现适配,这时候用DataFrame即Dataset[Row]就能比较好的解决问题。

创建DataFrame

读取文本文件创建DataFrame

第一种方式:通过RDD配合case class进行转换DF

第一步:创建文本文件
在linux的/export/servers/路径下创建文本文件

cd /export/servers/
vim person.txt

1 zhangsan 20
2 lisi 29
3 wangwu 25
4 zhaoliu 30
5 tia

你可能感兴趣的:(spark)