scrapy抓取豆瓣报出403错误

调试的时候在setting里把LOG_LEVEL改DEBUG,就可以看到是哪一个页面出问题了。实际上INFO里有一个200那个应该就是成功请求了你要看的top250。403不是你抓不到数据的原因,需要注意的地方有两个:1.你在start_requests里面的Request后面没有加callback=self.parse,导致只请求了链接,而没有调用处理函数。2.在setting里需要把ROBOTSTXT_OBEY设置为False,否则新的scrapy默认遵守robots协议。具体可以参考官网文档的说明Spiders - Scrapy 1.3.2 documentation
■网友
【scrapy抓取豆瓣报出403错误】 在settings.py文件中加上
USER_AGENT = \u0026#39;Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36\u0026#39;就行了

■网友
应该是douban做了反爬虫策略。

■网友
我也遇到同样的问题 楼主解决了吗、?

■网友
被反爬虫了,可能是抓太快了。


    推荐阅读