百度蜘蛛大量抓取不存在的URL,比如说需要在“搜索框”搜索关键词的页面;再比如说产品详情页已经下架了,整站页面上根本没有展示此类URL,但依然抓取。这可能是啥原因呢
一般爬虫对页面的重访是主要原因。依流量及抓取量情况来分析,如果能用robots的规则屏蔽这部分页面的话,效果最直接。
■网友
这些URL曾经被记录过并且被放入了待抓取列表中
■网友
详情页下架后,哪怕站内没有给入口,SE是依然会定期重访这些已收录页面的,这是SE本身的工作机制。
■网友
其实总的来说会有几个原因1.这些url是曾经被记录过的2.蜘蛛抓取时候通过你网站的动态参数去计算你的列表页或者一些文章页进行更快速的抓取3.用户从搜索引擎中搜索错误的网址,而且搜索次数不只有一次两次4.百度蜘蛛自身的程序问题5.如果页面存在一些ajax、js等的调用,而在刚开始的时候没有做出robots屏蔽,那么搜索引擎很有可能会进行抓取,而且有时候还会使用post方式进行获取。6.站内是否有错误的链接指向这些页面,比如说程序员的url写错之类的解决办法:1.抓出来这些页面是否真实生成,有可能是程序员设计的一些缺陷而造成的空页面,请将它们定向到4042.如果页面真的不存在建议进行robots的修改,屏蔽蜘蛛(进行robots的修改后记得向搜索引擎的端口进行提交,否则识别的时间会更长,更改robots后从日志中观察继续抓取该类地址实属正常,蜘蛛需要一段时间进行适应,这里特指百度蜘蛛,因为我个人不做谷歌的)3.检查是否存在问题6,如果存在问题6,请孤立这些不存在的链接,然后设置返回404就可以了以上问题本人原创,并非转载,个人qq:290086891,希望各位转载得朋友们留个qq号
■网友
【百度蜘蛛大量抓取不存在的URL,比如说需要在“搜索框”搜索关键词的页面;再比如说产品详情页已经下架了,整站页面上根本没有展示此类URL,但依然抓取。这可能是啥原因呢】 死链要设置好404
还有可以在robots中禁止抓取
不过不会马上见效,有个过程
■网友
将这些url 404处理
■网友
这和百度蜘蛛的算法有关,比较可能的原因是,百度通过收录的网页进行抓爬行,尽管当前已经更新了网站信息,但是收录也就是快照没有更新前,蜘蛛会重复抓取这些历史遗留的连接。你需要做的就是,做一个蜘蛛屏蔽的规则,就能彻底解决问题。
■网友
我能在这儿问个问题吗??就是: 怎么样让百度蜘蛛重新扒我的网站?之前扒是网站里面的一篇新闻!还有就是之前没有加Keywords和Description!现在加上了!网址是:快发助手-国内最大的手游融合分发商.快发SDK目前最专业的渠道SDK接入平台
■网友
根据我有限的经验,蜘蛛来源可能是用户访问(加载统计代码,如果有的话),以及外链,甚至第三方人士进行提交,以及曾经抓取过的页面因为搜索引擎重新抓取策略而重新访问。一部分答案可以参考百度站长社区【天音锦】或者【响1亮2的3名4字】的一些主题帖或回答。应对方法也比较简单,如果这类页面没有被抓取的价值,并且url形式能够以通配符表达,那么可以robots.txt封禁掉。其次,在页面源代码上也需要注意,不要对搜索词进行自动调用。再次,可以在页面源代码head区间加入meta robots noindex标签声明不建立索引。网站出现大量预期外页面被搜索引擎抓取,有可能是网站设计上的问题,用上面的方式解决。也有可能正在被黑帽客利用,需要结合多方面数据进行判断。
■网友
robots屏蔽吧,另:产品下架以后保持页面可以访问,无法预定或购买。
推荐阅读
- 它浑身是毒,入侵我国却被大量种植,如今年产量高达55万吨
- 为啥开通了百度云超级会员下载速度还是会那么慢
- 浏览器突然上不了百度
- 汽车市场|「数据报告」比亚迪外供底盘数量激增,大量车企同时配套比亚迪电池电机
- 怎样看待财新周刊的文章《百度灰生态》
- 百度挂了,打开不了,时间2017年2月28日晚上9点左右
- Facebook, Google, 百度等公司自制开源服务器,对IBM,HP,Dell等传统服务器生产商的冲击是啥
- 百度统计是否有统计页面上某个按钮被点击次数的功能
- 百度游戏和完美世界的选择
- 有车club|首搭蜘蛛智联网中网 刷抖音开视频会议全满足 试驾2021款G20
