最近用到python 爬取智联招聘上的网页,想把页面保存本地:
def writeintofile(filename, str):
# 打开文件
fo = open(filename, 'w') # 写的方式打开文件
print("文件名: ", fo.name)
# 在文件末尾写入一行
fo.write(str)
# 关闭文件
fo.close()
报出错误:UnicodeEncodeError: ‘gbk’ codec can’t encode character ‘\xa0’ in position 1806: illegal multibyte sequence
原因如下:
1.‘gbk’ codec can’t encode character :说明是将Unicode字符编码为GBK时候出现了问题,可能是本身Unicode类型的字符中,包含了一些无法转换为GBK编码的一些字符;
2.gbk无法转换’\xa0’字符,所以在转换前需要将“\xa0”替换掉;使用string.replace(u’\xa0’, u’ ‘);
因此,我们使用:
fo.write(str.replace(u'\xa0', u''))
即可解决问题;
另外一种解决办法,在gbk解码时忽略掉不能解码的数据:
fo.write(content.encode("gbk", 'ignore').decode("gbk", "ignore"))
或者采用如下方式:
fo = open(filename, 'w', encoding="utf-8")
fo.write(str)
三种解决方法都成功。