GitHub 上有哪些优秀的 Python 爬虫项目( 十 )

如下所示为搜索「秋天」,并完成下载的图像:
每一个网站都会有对应的登录代码,有的还有数据的爬取代码。以豆瓣为例,主要的登录函数如下所示,它会获取验证码、处理验证码、返回登录数据完成登录,并最后保留 cookies。def login(): captcha, captcha_id = get_captcha() # 增加表数据 datas = captcha datas = captcha_id login_page = session.post(url, data=https://www.zhihu.com/api/v4/questions/58151047/datas, headers=headers) page = login_page.text soup = BeautifulSoup(page,"html.parser") result = soup.findAll(\u0026#39;div\u0026#39;, attrs={\u0026#39;class\u0026#39;: \u0026#39;title\u0026#39;}) #进入豆瓣登陆后页面,打印热门内容for item in result: print(item.find(\u0026#39;a\u0026#39;).get_text()) # 保存 cookies 到文件, # 下次可以使用 cookie 直接登录,不需要输入账号和密码 session.cookies.save()其中获取并解决验证码的函数如下:def get_captcha():\u0026#39;\u0026#39;\u0026#39; 获取验证码及其ID \u0026#39;\u0026#39;\u0026#39; r = requests.post(url, data=https://www.zhihu.com/api/v4/questions/58151047/datas, headers=headers) page = r.text soup = BeautifulSoup(page,"html.parser") # 利用bs4获得验证码图片地址 img_src = https://www.zhihu.com/api/v4/questions/58151047/soup.find(/u0026#39;img/u0026#39;, {/u0026#39;id/u0026#39;: /u0026#39;captcha_image/u0026#39;}).get(/u0026#39;src/u0026#39;) urlretrieve(img_src, /u0026#39;captcha.jpg/u0026#39;)try: im = Image.open(/u0026#39;captcha.jpg/u0026#39;) im.show() im.close() except: print(/u0026#39;到本地目录打开captcha.jpg获取验证码/u0026#39;)finally: captcha = input(/u0026#39;please input the captcha:/u0026#39;) remove(/u0026#39;captcha.jpg/u0026#39;) captcha_id = soup.find(/u0026#39;input/u0026#39;, {/u0026#39;type/u0026#39;: /u0026#39;hidden/u0026#39;, /u0026#39;name/u0026#39;: /u0026#39;captcha-id/u0026#39;}).get(/u0026#39;value/u0026#39;)return captcha, captcha_id当然这些都是简单的演示,在 GitHub 项目中可以找到更多的示例。此外,作者表明由于网站策略或者样式改变而导致代码失效,我们也可以提 Issue 或 Pull Requests。最后,该项目未来还会一直维护,很多东西哦也会慢慢改进,项目作者表明:
项目写了一段时间后,发现代码风格、程序易用性、可扩展性、代码的可读性,都存在一定的问题,所以接下来最重要的是重构代码,让大家可以更容易的做出一些自己的小功能;如果读者觉得某个网站的登录很有代表性,可以在项目 issue 中提出;网站的登录机制有可能经常的变动,所以当现在的模拟的登录的规则不能使用的时候,请项目在 issue 中提出。3、大型图片爬虫
Github地址:https://github.com/sczhengyabin/Image-Downloader
如果你经常使用百度图片,却又很难找到自己想要的图片,那么这个Github项目,就是你必须拿下的。
这个爬虫程序,可以根据自己的需求,定制爬取图片,支持百度、谷歌和必应,抓取速度很快,2000张图片,约3分钟的时间,就可以成功完成。
推荐阅读
- 医院|感染艾滋病毒初期有哪些征兆?可以自行检查吗?共用马桶会传染吗
- 玩游戏花钱最多的有哪些游戏,哪些人
- 旅行|需要准备哪些物品?全面冬季出游清单,建议收藏带宝宝出门旅行
- 红米手机通过QQ空间的成功营销,给涉足社会化营销的企业有哪些启示
- 互联网在线音乐行业有哪些可能的盈利模式
- 直播会成为品牌传播的另一个途径么有哪些可行的方法感觉有戏又没头绪好捉急。
- 侧重业务逻辑的产品需求规格说明书,需要有哪些要点
- 大学|上海大学第8,前10名有哪些高校?上海市30所大学排名
- 小米手机的指纹信息保管安全吗
- 学图像处理有哪些不错的书推荐
