爬虫违反了新浪微博的使用协议吗( 二 )

Disallow(相当于“法不禁止皆可为”),有的站点仅开放部分可以爬取的范围,即使用Allow(相当于“法不允许皆不为”)。比如说360:
http://www.360.cn/robots.txt其协议内容很简单:
User-agent: *Allow: /其允许所有用户的所有爬取范围。可能这就是作为安全大佬的自信了吧。
拓展部分 【爬虫违反了新浪微博的使用协议吗】 当然,除了这项协议之外,有些网站也采取了反爬措施,比如需要验证UA、验证码、登录之类,在技术上可以实现爬取。但看到人家采取了一些更为高级的反爬措施的时候,尽量自觉停止数据爬取,因为可能涉及到一些比较重要的数据,很可能会不小心背上官司。
还有一点,有时候某些爬取行为会产生对服务器过于频繁的访问,这或许会被看作是攻击行为。传统上有反爬设置的站点会采取封禁IP的措施,如果是通过WiFi进行爬取导致IP被封,则接下来一段时间内所有通过该WiFi连接网络的所有设备由于在公网共用该IP,会被该站点拒绝服务并显示IP封禁提醒。可通过切换网络、修改IP或等待一段时间解决。
法律层面,请参看最高检的文章:
最高人民检察院:法学汇|网络爬虫的入罪标准与路径研究


推荐阅读