网络资源下载过程中的一个问题

是因为这个网站对Google特殊对待了,如果所有访问都要先登录,那么Google的spider去爬取网站页面的时候也会被挡住,其他人就不能通过搜索关键字来找到网站的页面了,这对于推广网站非常不利。所以许多网站会在搜索引擎抓取时网开一面,不要求登录。网站检测是否是爬虫主要是依赖UserAgent,知名搜索引擎有独特的UserAgent来提示网站自己是爬虫自动爬取。有些网页在搜索引擎里面的摘要和真正点进去的效果完全不同,一部分也是这个原理。也可以利用这种技术,伪造自己的UserAgent为爬虫,就可以不登录读取到内容了。但是,IT人员何苦要互相伤害呢……
■网友
說明這個網站設計有漏洞。搜索引擎的爬蟲工作原理(極簡化版)是:1 建立一個隊列。2 把要訪問的網站的根頁面地址加入這個隊列。3 訪問隊列第一個頁面,分析出上面的信息。如果頁面上有任何超鏈接,把他們都加到隊列中。4 循環步驟3,直到沒有頁面遺留。由於爬蟲是不會進行登錄的,所以網站通常會對爬蟲的Agent進行識別,并給與一定特權,允許訪問一些原本需要登錄的信息。這就是為什麼它可以檢索到這些地址。但是,漏洞來了:在訪問這些地址的時候,服務器應該再次驗證當前的訪問者是否有權限,而不是直接放行。所以你想要的技術,本質上是基於網站的漏洞實現的。除用於安全掃描,并沒有普遍應用意義。
■网友
.pdf site:http://www.aaa.com


    推荐阅读