python 写入文件时,报错:UnicodeEncodeError: 'gbk' codec can't encode character '\xa0' in position 1806: ille

最近用到python 爬取智联招聘上的网页,想把页面保存本地:

def writeintofile(filename, str):
    # 打开文件
    fo = open(filename, 'w')      # 写的方式打开文件
    print("文件名: ", fo.name)
    # 在文件末尾写入一行
    fo.write(str)

    # 关闭文件
    fo.close()

报出错误:UnicodeEncodeError: ‘gbk’ codec can’t encode character ‘\xa0’ in position 1806: illegal multibyte sequence

原因如下:
1.‘gbk’ codec can’t encode character :说明是将Unicode字符编码为GBK时候出现了问题,可能是本身Unicode类型的字符中,包含了一些无法转换为GBK编码的一些字符;

2.gbk无法转换’\xa0’字符,所以在转换前需要将“\xa0”替换掉;使用string.replace(u’\xa0’, u’ ‘);
因此,我们使用:

fo.write(str.replace(u'\xa0', u'')) 

即可解决问题;

另外一种解决办法,在gbk解码时忽略掉不能解码的数据:

fo.write(content.encode("gbk", 'ignore').decode("gbk", "ignore"))

或者采用如下方式:

fo = open(filename, 'w', encoding="utf-8")  
fo.write(str)

三种解决方法都成功。

你可能感兴趣的:(Python)