爬虫违反了新浪微博的使用协议吗( 二 )
Disallow(相当于“法不禁止皆可为”),有的站点仅开放部分可以爬取的范围,即使用Allow(相当于“法不允许皆不为”)。比如说360:
http://www.360.cn/robots.txt其协议内容很简单:User-agent: *Allow: /其允许所有用户的所有爬取范围。可能这就是作为安全大佬的自信了吧。
拓展部分 【爬虫违反了新浪微博的使用协议吗】 当然,除了这项协议之外,有些网站也采取了反爬措施,比如需要验证UA、验证码、登录之类,在技术上可以实现爬取。但看到人家采取了一些更为高级的反爬措施的时候,尽量自觉停止数据爬取,因为可能涉及到一些比较重要的数据,很可能会不小心背上官司。
还有一点,有时候某些爬取行为会产生对服务器过于频繁的访问,这或许会被看作是攻击行为。传统上有反爬设置的站点会采取封禁IP的措施,如果是通过WiFi进行爬取导致IP被封,则接下来一段时间内所有通过该WiFi连接网络的所有设备由于在公网共用该IP,会被该站点拒绝服务并显示IP封禁提醒。可通过切换网络、修改IP或等待一段时间解决。
法律层面,请参看最高检的文章:
最高人民检察院:法学汇|网络爬虫的入罪标准与路径研究
推荐阅读
- 新浪微博创新基金投资了哪些团队
- python 爬虫,咋获得输入验证码之后的搜索结果
- 新浪汽车出品|配置提升是重点 试驾东风日产2021款天籁
- |2020年10月南京市查处违反中央八项规定精神问题60起
- 新浪汽车出品|两种外观任君选择 艾瑞泽5 PLUS新车解析
- 高考|志愿无忧网荣获新浪教育“2020年度口碑影响力高考升学规划机构”
- 新浪汽车出品|新能源是如何改变汽车设计潮流的
- 新浪微博之类平台,怎样抵御群体性人身攻击
- 1、相同的网址,为啥浏览器http和https都能登录,而爬虫不行\n2、网页下载内容不全
- kindle设备出租是否违反规定
