用shell分析网站日志,咋计算出蜘蛛访问时间和访问次数
把03/Jun/2013:17:56:35转化成时间戳timestamp记录每个ip的时间戳和上个时间戳进行对比。如果\u0026gt;1800,则visit+1记录下同一IP所有lasttime-firsttime之和还可以计算停留时间。。
■网友
统计次数用wc -l就可以了,至于访问时间,这个我不太理解你的意思,如果你指的是页面下载时间的话,应该可以修改httpd.conf增加这个字段的输出
■网友
蜘蛛日志本来就是假的概念,还算什么访问时间和次数。
■网友
只想知道次数的话:grep Baiduspider * | wc -l想看每个页面被抓次数的话:grep Baiduspider * | awk \u0026#39;{print $7}\u0026#39;| sort |uniq -c|sort -n|tac
■网友
明天给你上SHELL代码
■网友
同问。shell计算停留时间不会统计抓取量的话还得补一段代码nslookup \u0026lt;ip.txt 之类的反解出ip 找出真实的百度蜘蛛。抓取量理解一下其实就是一共来访了多少次光年日志的次数不是这样理解的。 @seobishop给出了答案。学习了!
■网友
光年日志分析工具的蜘蛛访问时间是这样的逻辑的:如果同一IP蜘蛛在半个小时内没有再来访问,那么就认为该蜘蛛离开了。该蜘蛛最早访问的时间-最后一次访问的时间等于该蜘蛛的访问时间。把所有蜘蛛访问时间相加就等于总时间。估计你要先把所有蜘蛛的ip过滤出来然后按时间排序,看2条记录之间的时间差是否大于30分钟,计算单个蜘蛛的爬取时间最后把所有蜘蛛爬取时间相加,就是你想要的了。本人SHELL白痴,其他大神帮忙回答技术方面的东西吧
■网友
正常的 spider 在爬取的时候使用的 user agent 是带网址的,貌似像这样XXXSpider 1.23 (+http://xxx.com/xxx)所以,要分离出爬虫请求,除了用 source ip 来分之外,就是拿 user agent 了。有些 web server 的 access log 默认不输出 user agent(例如 apache),你得先手动改掉 log 的格式。分离出爬虫请求之后,下一步统计个数就 wc -l 等等很多办法了,占用时间和占用带宽什么的也可以简单地用 awk 之类搞定。
推荐阅读
- 有啥方法,网站,项目可以自己练习计算广告学
- 设计专业学生上传自己的作品,用哪个网站比较好
- 大学要开始查文献le,求问有哪些中英文的文献网站或下载工具(最好是医药,生命科学类的),多谢啦?
- 电商网站支付流程的流失率是怎么样的从用户点击充值/支付按钮,到支付完成,其中每一步的流失比率都是咋样的
- |新款领克01竞争力分析:推荐入门版 价格门槛提高2.9万元
- 能否推荐一个能用快播看电影且电影都是中英双字幕的网站
- 浏览器突然上不了百度
- 咋自己发布网站
- 有没有网站能够搜出我给的类似风格图片的网站
- 类似“斗鱼tv 熊猫tv”的国外直播网站有哪些
