RDD和DataFrame和DataSet三者间的区别

参考：https://blog.csdn.net/weixin_43087634/article/details/84398036

在SparkSQL中Spark提供了两个新的抽象，分别是DataFrame和DataSet。他们和RDD有什么区别呢？首先从版本的产生上来看：

RDD (Spark1.0) —> Dataframe(Spark1.3) —> Dataset(Spark1.6)

如果同样的数据都给到这三个数据结构，他们分别计算之后，都会给出相同的结果。不同是的他们的执行效率和执行方式。

在后期的Spark版本中，DataSet会逐步取代RDD和DataFrame成为唯一的API接口。

RDD

Dataframe

与RDD类似，DataFrame也是一个分布式数据容器。然而DataFrame更像传统数据库的二维表格，除了数据以外，还记录数据的结构信息，即schema。

从API易用性的角度上看，DataFrame API提供的是一套高层的关系操作，比函数式的RDD API要更加友好，门槛更低。

RDD和DataFrame和DataSet三者间的区别

DataFrame除了提供了比RDD更丰富的算子以外，更重要的特点是提升执行效率、减少数据读取以及执行计划的优化，比如filter下推、裁剪等。

性能上比RDD要高，主要有两方面原因：

Dataframe的劣势在于在编译期缺少类型安全检查，导致运行时出错。

Dataset

是Dataframe API的一个扩展，是Spark最新的数据抽象；
用户友好的API风格，既具有类型安全检查也具有Dataframe的查询优化特性；
Dataset支持编解码器，当需要访问非堆上的数据时可以避免反序列化整个对象，提高了效率；
样例类被用来在Dataset中定义数据的结构信息，样例类中每个属性的名称直接映射到DataSet中的字段名称；
Dataframe是Dataset的特列，DataFrame=Dataset[Row] ，所以可以通过as方法将Dataframe转换为Dataset。Row是一个类型，跟Car、Person这些的类型一样，所有的表结构信息我都用Row来表示；
DataSet是强类型的。比如可以有Dataset[Car]，Dataset[Person]。

DataFrame只是知道字段，但是不知道字段的类型，所以在执行这些操作的时候是没办法在编译的时候检查是否类型失败的，比如你可以对一个String进行减法操作，在执行的时候才报错，而DataSet不仅仅知道字段，而且知道字段类型，所以有更严格的错误检查。就跟JSON对象和类对象之间的类比。

三者的共性

RDD、DataFrame、Dataset全都是spark平台下的分布式弹性数据集，为处理超大型数据提供便利；
三者都有惰性机制，在进行创建、转换，如map方法时，不会立即执行，只有在遇到Action如foreach时，三者才会开始遍历运算，极端情况下，如果代码里面有创建、转换，但是后面没有在Action中使用对应的结果，在执行时会被直接跳过；
三者都会根据spark的内存情况自动缓存运算，这样即使数据量很大，也不用担心会内存溢出；
三者都有partition的概念；
三者有许多共同的函数，如filter，排序等；
在对DataFrame和Dataset进行操作许多操作都需要 spark.implicits._ 这个包进行支持；
DataFrame和Dataset均可使用模式匹配获取各个字段的值和类型。

三者的区别

RDD:

DataFrame:

Dataset:

Dataset和DataFrame拥有完全相同的成员函数，区别只是每一行的数据类型不同；
DataFrame也可以叫Dataset[Row],每一行的类型是Row，不解析，每一行究竟有哪些字段，各个字段又是什么类型都无从得知，只能用上面提到的getAS方法或者共性中的第七条提到的模式匹配拿出特定字段。而Dataset中，每一行是什么类型是不一定的，在自定义了case class之后可以很自由的获得每一行的信息；
Dataset在需要访问列中的某个字段时是非常方便的，然而，如果要写一些适配性很强的函数时，如果使用Dataset，行的类型又不确定，可能是各种case class，无法实现适配，这时候用DataFrame即Dataset[Row]就能比较好的解决问题。

继续阅读