同一域名下同一性质部分网页无法爬虫,请问是啥原因造成的,应该怎样处理( 二 )


509 Bandwidth Limit Exceeded
服务器达到带宽限制。这不是一个官方的状态码,但是仍被广泛使用。
510 Not Extended
获取资源所需要的策略并没有没满足。
600 Unparseable Response Headers
源站没有返回响应头部,只返回实体内容

■网友
如果你抓谷歌的话, 用request模拟得再真, 也会被发现是爬虫, 返回503, 原因是人家对你的鼠标点击等行为都有analyse, 最好模拟能解析js的浏览器去做, selenium+ xxxxxx随便什么都行, 几点要注意1. user-agent要随机, 不要自己乱造2. 同IP太频繁, 绝对会被干掉, 再牛逼的爬虫也抵不过人家发现你IP流量过大而干掉你3. cookie的问题, 能存久一点就久一点,不要反复登录或者让对方新建cookie给你, 同一个cookie的话保持同一请求特征, 不要跳IP或者ua
■网友
第一个问题,正常浏览器是否能请求到页面?如果可以,那就证明你的爬虫请求构建有问题。第二个问题,该论坛是否需要cookie,如果需要,是否考虑了使用的cookie过期问题。第三个问题,也是比较重要的问题,是否使用了代理ip,如果没有,考虑使用代理,这也是我觉得这个问题的关键,爬虫被禁不止会返回40x,如果使用了,考虑代理时效性。第四个问题,爬虫爬取的速率,大部分反爬策略即是基于单位时间内的请求数,如果过快,控制并发数或者任务
■网友
补充一种可能:你抓取的参数设置不当,导致服务器生成这个页面出错。


推荐阅读