甜野猫 关于机器学习那些事儿:我们从企业学到哪些经验教训?( 四 )
深度学习背后的主要前提之一是它能够随着数据量的增加继续学习 , 这在大数据时代尤其有用(见下图) 。 这与硬件(即GPU)的最新发展相结合 , 允许执行由于资源限制而过去禁止的大型深度学习作业 。
神经网络模型的结果非常依赖于网络的体系结构和超参数 。 在大多数情况下 , 您需要一些网络架构方面的专业知识才能正确调整模型 。 在这方面还有一个重要的试错的组成部分 。
可解释性
正如我们之前看到的 , 许多用例不仅需要预测 , 还需要解释预测背后的原因:为什么贷款被拒绝?或者为什么保险单价格会上涨?虽然基于树和基于系数的算法直接允许可解释性 , 但神经网络不是这种情况 。 在本文中 , 介绍了一些解释深度学习模型的技巧 。
质量
根据我们的经验 , 对于大多数结构化数据集 , 神经网络模型的质量不一定比RandomForests和XGBoost的质量更好 。 DL擅长的地方实际上是涉及非结构化数据时 , 即图像、文本或音频 。 底线:不要用猎枪杀死一只苍蝇 。 诸如RandomForest和XGBoost之类的ML算法足以应对大多数结构化监督问题 , 也更容易调整、运行和解释 。 让DL在非结构化数据问题或强化学习中说话 。
10.不要让数据泄露在研究预测航班到达延迟的项目时 , 我意识到当我使用数据集中的所有可用功能时 , 我的模型突然达到了99%的准确率 。 我遗憾地意识到我使用出发延迟作为到达延迟的预测因子 。 这是数据泄漏的典型示例 , 当用于创建模型的任何特征在预测时不可用或未知时 , 就会发生数据泄漏 。
协作:轻松共享数据集、数据连接、代码、模型、环境和部署 。
C.治理和安全:不仅包括数据 , 还包括所有分析资产 。
d.模型管理、部署和再训练 。
F.模型偏见:检测并纠正受性别或年龄而产生偏见的模型 。
E.辅助数据管理:处理用于解决数据科学中最痛苦的任务的可视化工具 。
G.GPU:立即供应和配置以实现深度学习框架的最佳性能 , 例如TensorFlow 。
H.无代码建模:适用于统计人员 , 主题专家 , 甚至是不编码但希望直观地构建模型的高管 。
推荐阅读
- 上海市科学技术委员会|关于做好制订因公出国(境)培训中期规划的补充通知
- 新华网|各显神通的“机器伙伴”
- 上海市教育委员会网站|关于转发《上海市幼儿园办园质量评价指南(试行稿)》的通知
- 机器人病毒检测、无人机送快递……来看2020服贸会服务机器人展区的智能高科技
- 顺园谈历史|吕不韦是秦始皇的生父吗?这传闻如何而来?
- 餐宝典|餐饮业十大发展趋势:洗牌、资本、供应链、机器人……
- LeoGo科技|科沃斯除菌地宝N8和米家扫拖机器人横评——两款解放双手的精品
- 中国历史上发生的疫情|中国历史上发生的疫情?中国历史上发生的疫情:中国历代发生大的疫灾
- 机器人:温柔可爱软妹子X优雅迷人贵公子
- 「机器人」优必选机器人Walker浇花踢球 视觉技术再升级
