同一域名下同一性质部分网页无法爬虫,请问是啥原因造成的,应该怎样处理( 二 )
509 Bandwidth Limit Exceeded
服务器达到带宽限制。这不是一个官方的状态码,但是仍被广泛使用。
510 Not Extended
获取资源所需要的策略并没有没满足。
600 Unparseable Response Headers
源站没有返回响应头部,只返回实体内容
■网友
如果你抓谷歌的话, 用request模拟得再真, 也会被发现是爬虫, 返回503, 原因是人家对你的鼠标点击等行为都有analyse, 最好模拟能解析js的浏览器去做, selenium+ xxxxxx随便什么都行, 几点要注意1. user-agent要随机, 不要自己乱造2. 同IP太频繁, 绝对会被干掉, 再牛逼的爬虫也抵不过人家发现你IP流量过大而干掉你3. cookie的问题, 能存久一点就久一点,不要反复登录或者让对方新建cookie给你, 同一个cookie的话保持同一请求特征, 不要跳IP或者ua
■网友
第一个问题,正常浏览器是否能请求到页面?如果可以,那就证明你的爬虫请求构建有问题。第二个问题,该论坛是否需要cookie,如果需要,是否考虑了使用的cookie过期问题。第三个问题,也是比较重要的问题,是否使用了代理ip,如果没有,考虑使用代理,这也是我觉得这个问题的关键,爬虫被禁不止会返回40x,如果使用了,考虑代理时效性。第四个问题,爬虫爬取的速率,大部分反爬策略即是基于单位时间内的请求数,如果过快,控制并发数或者任务
■网友
补充一种可能:你抓取的参数设置不当,导致服务器生成这个页面出错。
推荐阅读
- 海南昌江警方拍卖黄鸿发黑社会性质组织涉案财产:单个标的物拍出18.28亿
- 广州同一入境航班检出2例输入性恶性疟个案
- 应该怎样理解会员服务的法律性质
- 漏洞|家里有孩子的,一定不要忽略这个漏洞!警惕!同一小区8人确诊
- 在水产公司做搬运工的弟弟感染后,住同一小区的姐姐也检出阳性!最新疫情动态…
- 同一款手游为啥会有多家代理
- 环球车讯网|都是2.0T,竟然相差100马力!同一款发动机,为何要分高低功率?
- 怎样看待知乎的非原创
- 为啥通过wisp连接的路由与同一网段下的其他设备不通
- 老侯解车|同一款车型,5挡手动与6挡自动,这些隐藏的差别你知道吗?
