咋学用Python爬虫

使劲爬咯,爬博客、爬、爬妹子图,我不会告诉你我喜欢Python是因为用来写爬虫比较容易?逃。------------------------------------------------------------------------------------------------------------------------------------------ 好了,这是玩笑,通常来讲,编写一个爬虫基本上需要三个步骤:抓取网页、分析字符、保存内容。 首先抓取网页你要了解HTTP相关的内容,在Python中主要是urllib和urllib2这两个模块,网页抓取建议从无需登陆、无需cookie、无需验证码开始,然后再慢慢向着登陆、cookie、验证码这些高阶内容过渡,还要考虑网页超时、多线程等等这些因素吧! 其次分析字符,一般通用的是正则表达式,可是这玩意儿设计太反人类,如果你能精通或者搞懂你就用这个,否则你可以考虑使用beautifulsoup这个大杀器,当然你要用纯字符串分析的方法也是可以的,不过效率实在是不敢恭维。 最后保存内容这块,可能涉及到IO读写、数据库、Excel这些内容,比如你想从网页上抓取妹子图然后保存到本地,基本上就是IO的内容啦!
■网友
爬虫需要掌握Python基础,re正则模块,Beatifulsoup,pyquery,xpath,selenium,scrapy等一些知识点,能爬取任何网站,包括某宝,某东。建议先去一些Python网站学习基础教程,然后再去深入学习python爬虫。蚁小二python小课就不错,零基础也能学习。

【咋学用Python爬虫】


    推荐阅读