文章插图
Python 是一个很棒的语言 。它是世界上发展最快的编程语言之一 。它一次又一次地证明了在开发人员职位中和跨行业的数据科学职位中的实用性 。整个 Python 及其库的生态系统使它成为全世界用户(初学者和高级用户)的合适选择 。它的成功和流行的原因之一是它强大的第三方库的集合,这些库使它可以保持活力和高效 。
在本文中,我们会研究一些用于数据科学任务的 Python 库,而不是常见的比如 panda、scikit-learn 和 matplotlib 等的库 。尽管像 panda 和 scikit-learn 这样的库,是在机器学习任务中经常出现的,但是了解这个领域中的其它 Python 产品总是很有好处的 。
一、Wget从网络上提取数据是数据科学家的重要任务之一 。Wget 是一个免费的实用程序,可以用于从网络上下载非交互式的文件 。它支持 HTTP、HTTPS 和 FTP 协议,以及通过 HTTP 的代理进行文件检索 。由于它是非交互式的,即使用户没有登录,它也可以在后台工作 。所以下次当你想要下载一个网站或者一个页面上的所有图片时,wget 可以帮助你 。
安装:
$ pip install wget
例子:import wgeturl = 'http://www.futurecrew.com/skaven/song_files/mp3/razorback.mp3'filename = wget.download(url)100% [................................................] 3841532 / 3841532filename'razorback.mp3'### Pendulum
二、Pendulum对于那些在 python 中处理日期时间时会感到沮丧的人来说,Pendulum 很适合你 。它是一个简化日期时间操作的 Python 包 。它是 Python 原生类的简易替代 。请参阅文档深入学习 。安装:
$ pip install pendulum
例子:import pendulumdt_toronto = pendulum.datetime(2012, 1, 1, tz='America/Toronto')dt_vancouver = pendulum.datetime(2012, 1, 1, tz='America/Vancouver')print(dt_vancouver.diff(dt_toronto).in_hours())3
三、imbalanced-learn可以看出,当每个类的样本数量基本相同时,大多数分类算法的效果是最好的,即需要保持数据平衡 。但现实案例中大多是不平衡的数据集,这些数据集对机器学习算法的学习阶段和后续预测都有很大影响 。幸运的是,这个库就是用来解决此问题的 。它与 scikit-learn 兼容,是 scikit-lear-contrib 项目的一部分 。下次当你遇到不平衡的数据集时,请尝试使用它 。安装:
pip install -U imbalanced-learn# 或者conda install -c conda-forge imbalanced-learn
例子:使用方法和例子请参考文档 。四、FlashText在 NLP 任务中,清理文本数据往往需要替换句子中的关键字或从句子中提取关键字 。通常,这种操作可以使用正则表达式来完成,但是如果要搜索的术语数量达到数千个,这就会变得很麻烦 。Python 的 FlashText 模块是基于 FlashText 算法为这种情况提供了一个合适的替代方案 。FlashText 最棒的一点是,不管搜索词的数量如何,运行时间都是相同的 。你可以在这里了解更多内容 。
安装:
$ pip install flashtext
例子:提取关键字from flashtext import KeywordProcessorkeyword_processor = KeywordProcessor()# keyword_processor.add_keyword(<unclean name>, <standardised name>)keyword_processor.add_keyword('Big Apple', 'New York')keyword_processor.add_keyword('Bay Area')keywords_found = keyword_processor.extract_keywords('I love Big Apple and Bay Area.')keywords_found['New York', 'Bay Area']
替换关键字keyword_processor.add_keyword('New Delhi', 'NCR region')new_sentence = keyword_processor.replace_keywords('I love Big Apple and new delhi.')new_sentence'I love New York and NCR region.'Fuzzywuzzy
五、fuzzywuzzy这个库的名字听起来很奇怪,但是在字符串匹配方面,fuzzywuzzy 是一个非常有用的库 。可以很方便地实现计算字符串匹配度、令牌匹配度等操作,也可以很方便地匹配保存在不同数据库中的记录 。安装:
$ pip install fuzzywuzzy
例子:from fuzzywuzzy import fuzzfrom fuzzywuzzy import process# 简单匹配度fuzz.ratio("this is a test", "this is a test!")97# 模糊匹配度fuzz.partial_ratio("this is a test", "this is a test!")100
更多有趣例子可以在 GitHub 仓库找到 。六、PyFlux时间序列分析是机器学习领域中最常见的问题之一 。PyFlux 是 Python 中的一个开源库,它是为处理时间序列问题而构建的 。该库拥有一系列优秀的现代时间序列模型,包括但不限于 ARIMA、GARCH 和 VAR 模型 。简而言之,PyFlux 为时间序列建模提供了一种概率方法 。值得尝试一下 。
推荐阅读
- 24寸和26寸箱哪个实用?
- 痛风能吃蚝油吗
- 新录用的公务员定什么级别?
- ACDSee 最好用的版本
- Netty客户端断线重连实现及问题思考
- linux du命令
- 《王者荣耀》与孙尚香的实践分析
- 6款超好用的macOS工具软件,提高Mac使用体验
- 用Python提取Verilog网表层次和实例化关系
- 用PS把电视画面变成震撼的真实效果