Python 抓取网页乱码原因分析

2020-06-19 00:00:00 网页编码抓取这种情况乱码

在用 python2 抓取网页的时候，经常会遇到抓下来的内容显示出来是乱码。

发生这种情况的大可能性就是编码问题：运行环境的字符编码和网页的字符编码不一致。

比如，在 windows 的控制台（gbk）里抓取了一个 utf-8 编码的网站。或者，在 Mac / Linux 的终端（utf-8）里抓取了一个 gbk 编码的网站。因为多数网站采用 utf-8 编码，而不少人又是用 windows，所有这种情况相当常见。

如果你发现你抓下来的内容，看上去英文、数字、符号都是对的，但中间夹杂了一些乱码，那基本可以断定是此情况。

解决这个问题的办法就是，把结果先按网页的编码方式 decode 解码成 unicode，再输出。如果不确定网页的编码，可参照以下代码：

import urllib
req = urllib.urlopen("http://some.web.site")
info = req.info()
charset = info.getparam('charset')
content = req.read()
print content.decode(charset, 'ignore')

相关文章