scrapy抓取豆瓣报出403错误
调试的时候在setting里把LOG_LEVEL改DEBUG,就可以看到是哪一个页面出问题了。实际上INFO里有一个200那个应该就是成功请求了你要看的top250。403不是你抓不到数据的原因,需要注意的地方有两个:1.你在start_requests里面的Request后面没有加callback=self.parse,导致只请求了链接,而没有调用处理函数。2.在setting里需要把ROBOTSTXT_OBEY设置为False,否则新的scrapy默认遵守robots协议。具体可以参考官网文档的说明Spiders - Scrapy 1.3.2 documentation
■网友
【scrapy抓取豆瓣报出403错误】 在settings.py文件中加上USER_AGENT = \u0026#39;Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36\u0026#39;就行了
■网友
应该是douban做了反爬虫策略。
■网友
我也遇到同样的问题 楼主解决了吗、?
■网友
被反爬虫了,可能是抓太快了。
推荐阅读
- 豆瓣为啥受到同志社群的欢迎
- 豆瓣|豆瓣9.4分,却只有两千人看过:这部纪录片,我不敢看第二遍…
- 怎样看待豆瓣 FM 之类的音乐推荐系统与传统的主动找歌的听音方式相比,算不算一个完全革新的被动接受的听音模式会不会完全或者部分取代前者
- 豆瓣|《星球大战》达斯·维德饰演者去世
- IT桔子的数据是从公共的互联网上抓取的吗
- 注销豆瓣之前,有啥简便的备份方法吗
- 杨紫|播出两集豆瓣评分8.4,是什么剧能让杨幂杨紫0片酬出演?
- 陆毅|《一秒钟》豆瓣评分多少?张艺谋《一秒钟》剧情简介主演介绍
- 知乎豆瓣这样的网站,是不是中国的原创理念
- 是不是知乎豆瓣看多了,人会变得越来越浮躁?
