python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’( 二 )



我想看看到底空格和 \u0026amp;nbsp 有什么区别,所以用了repr(这就是火眼静静,用它能看到妖怪的原型。顺便,我想静静了)。输出结果如下:
python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’

\u0026amp;nbsp 的原型是 \\xc2\\xa0,空格就是空格。
然后我再把 \u0026#39;\\xe5\\x88\\xab\\xc2\\xa0\\xe5\\x90\\x8d\\xef\\xbc\\x9a\u0026#39; 粘贴到wing IDE 中:
python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’

再把红圈圈中的东西粘到 if 语句后面就好使了。
最后我拿到了\u0026amp;nbsp,大概像这样:
python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’

两个 \u0026#39;|\u0026#39; 之间的就是让人蛋疼不已的 \u0026amp;nbsp 了。
像题主这样的,只需要在自己的IDE上运行如上代码后获得 \u0026amp;nbsp 的具体化的东西,做匹配判断。如果相等跳过就好了。
具体做法如下:
python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’
【python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’】
把 | | 复制粘贴出来,再放到 == 后面,然后删去两边的\u0026#39; | \u0026#39;,可千万别都删了,\u0026amp;nbsp是有长度的,和空字符串不一样长。
希望对你也有帮助,当然了如果还是不好使的话就说明你该重启一下电脑、洗个澡、听一首很叼的歌(比如这个:Nadiya的单曲《Roc》: http://music.163.com/song/3171721/?userid=82060026 )再去追一个很漂亮的妹子、这样当你发现自己没钱请她吃好吃的时就可以回来和我一起想到底是为什么了。
已上

■网友
#html 是byte类型html.decode().replace(\u0026#39;\u0026amp;nbsp;\u0026#39;,\u0026#39;\u0026#39;).encode(encoding=\u0026#39;utf-8\u0026#39;)
■网友
txt文件是UTF-8,用的out = \u0026#39;\u0026#39;.join(eachone.split()),可以解决。


推荐阅读