天天看点

python2.7 pyspark显示以及插入hive表中文编码问题

我用python2.7的环境下读取excel,这个时候print pandas的dataframe时中文是可以显示的,说明不是python2.7的问题,然后将其转换成spark的dataframe的时候,show或者write到hive表的时候出现了中文乱码,这个时候我使用了pyspark.sql.functions.decode和encode函数,首先将它从utf-8进行解码,然后以ISO-8859-1进行编码,此时中文可以正常显示。

df = df.withColumn(column,encode(decode(col(column),'UTF-8'),'ISO-8859-1'))

继续阅读