网络资源下载过程中的一个问题
是因为这个网站对Google特殊对待了,如果所有访问都要先登录,那么Google的spider去爬取网站页面的时候也会被挡住,其他人就不能通过搜索关键字来找到网站的页面了,这对于推广网站非常不利。所以许多网站会在搜索引擎抓取时网开一面,不要求登录。网站检测是否是爬虫主要是依赖UserAgent,知名搜索引擎有独特的UserAgent来提示网站自己是爬虫自动爬取。有些网页在搜索引擎里面的摘要和真正点进去的效果完全不同,一部分也是这个原理。也可以利用这种技术,伪造自己的UserAgent为爬虫,就可以不登录读取到内容了。但是,IT人员何苦要互相伤害呢……
■网友
說明這個網站設計有漏洞。搜索引擎的爬蟲工作原理(極簡化版)是:1 建立一個隊列。2 把要訪問的網站的根頁面地址加入這個隊列。3 訪問隊列第一個頁面,分析出上面的信息。如果頁面上有任何超鏈接,把他們都加到隊列中。4 循環步驟3,直到沒有頁面遺留。由於爬蟲是不會進行登錄的,所以網站通常會對爬蟲的Agent進行識別,并給與一定特權,允許訪問一些原本需要登錄的信息。這就是為什麼它可以檢索到這些地址。但是,漏洞來了:在訪問這些地址的時候,服務器應該再次驗證當前的訪問者是否有權限,而不是直接放行。所以你想要的技術,本質上是基於網站的漏洞實現的。除用於安全掃描,并沒有普遍應用意義。
■网友
.pdf site:http://www.aaa.com
推荐阅读
- 郑州警方查获一盘踞境外网络赌博犯罪集团冻结资金逾5亿元
- 『徐州』徐州这群留守儿童的纯净声音抚慰人心 “6秒童声合唱团”走红网络
- 长春评选“网络奋斗者”:互联网成更多普通人创业工具
- 西藏航空一机长执飞过程中身体不适降落后送医去世
- 西藏首台5G网络车载移动CT仪器投用
- 朋友圈直播酒驾全过程?警方:当事人涉嫌酒驾接受调查
- 诈骗钱财|冒充专家高价兜售“特效药”、谎称卖口罩骗定金……警惕这些网络诈骗
- 正点财经|
- 大三学生准备日本留学过程中要不要准备考研
- 媒体聚焦网络知产保护:强化企业社会责任,完善行业监管体系
