十分钟搞定pandas
【Spark】3.RDD编程
以sql输出的结果创建df,这种形式最常用。
from pyspark.sql import SparkSession
from pyspark.sql import Row
from pyspark.sql.types import *
from pyspark.sql.functions import *
df = spark.sql("select * from table_name")
from pyspark.sql import Row
row = Row("spe_id", "InOther")
x = ['x1','x2']
y = ['y1','y2']
new_df = sc.parallelize([row(x[i], y[i]) for i in range(2)]).toDF()
test = []
test.append((1, 'age', '30', 50, 40))
test.append((1, 'city', 'beijing', 50, 40))
test.append((1, 'gender', 'fale', 50, 40))
test.append((1, 'height', '172cm', 50, 40))
test.append((1, 'weight', '70kg', 50, 40))
df = spark.createDataFrame(test,['user_id', 'attr_name','attr_value', 'income', 'expenses'])
createDataFrame有一个参数,samplingRatio。这个参数的含义是:如果df的某列的类型不确定,则抽样百分之samplingRatio的数据来看是什么类型。因此,我们一般设定其为1。即,只要该列有1个数据不为空,该列的类型就不会为null。
dataframe = spark.createDataFrame(RDD)
RDD = spark_df.rdd.map(lambda x:x)
pandas_pd=saprk_df.toPandas()
spark_df = spark.createDataFrame(pandas_df)