用python模拟登录知乎,爬回来的是乱码
第一种方法,解压服务器发回来的压缩数据~第二种方法,去掉request header中的『Accept-Encoding』头去掉~两种方法选一个就好~究其原因,简单来讲就是,Server在与Browser通信的过程中,会按照Browser支持的压缩格式压缩后再回复,所以你在header中加入了“Accept-Encoding”其实就是告诉Server:“嘿,我支持Gzip/../..,你压缩一下再给我吧~~~”然后Server就压缩了~~~自然你收到的数据就是压缩后的,你不解压就去读当然就成乱码了。第一种解决办法就是解压Server给你的压缩数据,第二种就是告诉服务器我不会解压,你别压缩~~~如上~~~
■网友
看python培训黄哥的三篇文章python开发爬虫汉字编码不再是问题:将python2中汉字会出现乱码的事一次性说清楚 article/python_bianma.md at master · pythonpeixun/article · GitHubpython爬虫访问多个网站、中文编码的处理。python爬虫访问多个网站、中文编码的处理。python3访问sina首页中文的处理 python3访问sina首页中文的处理
■网友
Accept-Encoding: gzip, deflate, br把br去掉!
■网友
gzip压缩的吧。。。。。。用gz库解压一下。
推荐阅读
- 怎样成为一名合格的Python程序员?
- python 爬虫,咋获得输入验证码之后的搜索结果
- 关于用phpfsocket 写Post, 模拟http 报文怎样写入要传输的处理数据
- python的html5lib这个库咋使用啊我在网上也没有找到相关文档
- 零基础入门学习啥语言好
- QQ在pc端同时登录两个为啥不会发生ip地址冲突
- Python3.4和3.5区别大么
- python 中 def_():...... return _有啥作用
- 新互联网网站用Java还靠谱么对比Php,Python,Ruby的话
- 客栈通PMS咋操作和携程账号直连
