Ufeff标识符中的无效字符

2022-04-14 00:00:00 python python-3.x python-3.4 urllib python-3.3

问题描述

我有以下代码：

import urllib.request

try:
    url = "https://www.google.com/search?q=test"

    headers = {}
    usag = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:25.0) Gecko/20100101 Firefox/25.0'
    headers['User-Agent'] = usag.encode('utf-8-sig')
    req = urllib.request.Request(url, headers=headers)
    resp = urllib.request.urlopen(req)
    respData = resp.read()

    saveFile = open('withHeaders.txt','w')
    saveFile.write(str(respData))
    saveFile.close()

except Exception as e:
    print(str(e))

它显示以下错误：

D:virtualenvsamplesurllibb>python 1.py
  File "1.py", line 35
    usag = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:25.0) Gecko/20100101 Firefox/25.0'ufeff
                                                                                              ^
 SyntaxError: invalid character in identifier

我看不到代码中的ufeff。

解决方案

ufeff是ZERO WIDTH NO-BREAK SPACE codepoint；打印时不呈现。它在UTF-16和UTF-32中用作byte order mark，用于记录编码字节的解码顺序(大端或小端)。

UTF-8不需要BOM(它只有一个固定的字节顺序，不需要跟踪替代的)，但微软认为它是一个方便的签名字符，供他们的工具检测UTF-8文件与8位编码(如大多数Windows代码页使用的编码)。

我怀疑您正在使用Microsoft文本编辑器(如记事本)保存代码。不要这样做，它会包含BOM，但Python不支持它，或者从UTF-8源文件中去掉它。您可能用记事本保存了文件，然后继续使用不同的工具向开头添加更多代码，BOM被夹在中间。

删除整行和下一行，然后重新键入它们，或者从您定义的字符串的右引号中选择，直到h在下一行的headers之前，删除该部分，然后重新插入换行符和足够的缩进。

如果您的编辑器支持在搜索和替换时使用转义序列(例如，在regex模式下SublimeText支持)，则只需使用来搜索字符并将其替换为空字符串。在SublimeText中，打开正则表达式支持并搜索x{feff}，用空字符串替换这些匹配项。

您在这里使用的Pythonutf-8-sig编码还包括该BOM：

headers['User-Agent'] = usag.encode('utf-8-sig')

HTTP标头也不应包括该代码点。Http标头通常改为使用拉丁文-1；在这里甚至ASCII也足够了，但在其他情况下使用'utf-8'(no-sig)。

您实际上不需要在那里使用str.encode()，也可以只定义一个字节字符串：

headers = {}
usag = b'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:25.0) Gecko/20100101 Firefox/25.0'
headers['User-Agent'] = usag

请注意字符串文本的b前缀。

相关文章