咋学用Python爬虫
使劲爬咯,爬博客、爬、爬妹子图,我不会告诉你我喜欢Python是因为用来写爬虫比较容易?逃。------------------------------------------------------------------------------------------------------------------------------------------ 好了,这是玩笑,通常来讲,编写一个爬虫基本上需要三个步骤:抓取网页、分析字符、保存内容。 首先抓取网页你要了解HTTP相关的内容,在Python中主要是urllib和urllib2这两个模块,网页抓取建议从无需登陆、无需cookie、无需验证码开始,然后再慢慢向着登陆、cookie、验证码这些高阶内容过渡,还要考虑网页超时、多线程等等这些因素吧! 其次分析字符,一般通用的是正则表达式,可是这玩意儿设计太反人类,如果你能精通或者搞懂你就用这个,否则你可以考虑使用beautifulsoup这个大杀器,当然你要用纯字符串分析的方法也是可以的,不过效率实在是不敢恭维。 最后保存内容这块,可能涉及到IO读写、数据库、Excel这些内容,比如你想从网页上抓取妹子图然后保存到本地,基本上就是IO的内容啦!
■网友
爬虫需要掌握Python基础,re正则模块,Beatifulsoup,pyquery,xpath,selenium,scrapy等一些知识点,能爬取任何网站,包括某宝,某东。建议先去一些Python网站学习基础教程,然后再去深入学习python爬虫。蚁小二python小课就不错,零基础也能学习。
【咋学用Python爬虫】
推荐阅读
- 怎样成为一名合格的Python程序员?
- python 爬虫,咋获得输入验证码之后的搜索结果
- python的html5lib这个库咋使用啊我在网上也没有找到相关文档
- 零基础入门学习啥语言好
- 用途|特殊医学用途食品对促进早产儿健康发育的重要性
- Python3.4和3.5区别大么
- python 中 def_():...... return _有啥作用
- 新互联网网站用Java还靠谱么对比Php,Python,Ruby的话
- 30岁男,创业失败转行学python,是否很晚?也不好找工作?
- Python 的开发速度比 C#.net 或 Vb.net 更快吗?
