python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’( 二 )
我想看看到底空格和 \u0026amp;nbsp 有什么区别,所以用了repr(这就是火眼静静,用它能看到妖怪的原型。顺便,我想静静了)。输出结果如下:
\u0026amp;nbsp 的原型是 \\xc2\\xa0,空格就是空格。
然后我再把 \u0026#39;\\xe5\\x88\\xab\\xc2\\xa0\\xe5\\x90\\x8d\\xef\\xbc\\x9a\u0026#39; 粘贴到wing IDE 中:
再把红圈圈中的东西粘到 if 语句后面就好使了。
最后我拿到了\u0026amp;nbsp,大概像这样:
两个 \u0026#39;|\u0026#39; 之间的就是让人蛋疼不已的 \u0026amp;nbsp 了。
像题主这样的,只需要在自己的IDE上运行如上代码后获得 \u0026amp;nbsp 的具体化的东西,做匹配判断。如果相等跳过就好了。
具体做法如下:
【python爬虫 爬取内容的时候\u0026nbsp 空格内容变成问号‘’】
把 | | 复制粘贴出来,再放到 == 后面,然后删去两边的\u0026#39; | \u0026#39;,可千万别都删了,\u0026amp;nbsp是有长度的,和空字符串不一样长。
希望对你也有帮助,当然了如果还是不好使的话就说明你该重启一下电脑、洗个澡、听一首很叼的歌(比如这个:Nadiya的单曲《Roc》: http://music.163.com/song/3171721/?userid=82060026 )再去追一个很漂亮的妹子、这样当你发现自己没钱请她吃好吃的时就可以回来和我一起想到底是为什么了。
已上
■网友#html 是byte类型html.decode().replace(\u0026#39;\u0026amp;nbsp;\u0026#39;,\u0026#39;\u0026#39;).encode(encoding=\u0026#39;utf-8\u0026#39;)
■网友
txt文件是UTF-8,用的out = \u0026#39;\u0026#39;.join(eachone.split()),可以解决。
推荐阅读
- 怎样成为一名合格的Python程序员?
- python 爬虫,咋获得输入验证码之后的搜索结果
- python的html5lib这个库咋使用啊我在网上也没有找到相关文档
- 零基础入门学习啥语言好
- Python3.4和3.5区别大么
- python 中 def_():...... return _有啥作用
- 新互联网网站用Java还靠谱么对比Php,Python,Ruby的话
- 30岁男,创业失败转行学python,是否很晚?也不好找工作?
- Python 的开发速度比 C#.net 或 Vb.net 更快吗?
- 1、相同的网址,为啥浏览器http和https都能登录,而爬虫不行\n2、网页下载内容不全
