甜野猫 关于机器学习那些事儿:我们从企业学到哪些经验教训?( 四 )


深度学习背后的主要前提之一是它能够随着数据量的增加继续学习 , 这在大数据时代尤其有用(见下图) 。 这与硬件(即GPU)的最新发展相结合 , 允许执行由于资源限制而过去禁止的大型深度学习作业 。
简单
神经网络模型的结果非常依赖于网络的体系结构和超参数 。 在大多数情况下 , 您需要一些网络架构方面的专业知识才能正确调整模型 。 在这方面还有一个重要的试错的组成部分 。
可解释性
正如我们之前看到的 , 许多用例不仅需要预测 , 还需要解释预测背后的原因:为什么贷款被拒绝?或者为什么保险单价格会上涨?虽然基于树和基于系数的算法直接允许可解释性 , 但神经网络不是这种情况 。 在本文中 , 介绍了一些解释深度学习模型的技巧 。
质量
根据我们的经验 , 对于大多数结构化数据集 , 神经网络模型的质量不一定比RandomForests和XGBoost的质量更好 。 DL擅长的地方实际上是涉及非结构化数据时 , 即图像、文本或音频 。 底线:不要用猎枪杀死一只苍蝇 。 诸如RandomForest和XGBoost之类的ML算法足以应对大多数结构化监督问题 , 也更容易调整、运行和解释 。 让DL在非结构化数据问题或强化学习中说话 。
10.不要让数据泄露在研究预测航班到达延迟的项目时 , 我意识到当我使用数据集中的所有可用功能时 , 我的模型突然达到了99%的准确率 。 我遗憾地意识到我使用出发延迟作为到达延迟的预测因子 。 这是数据泄漏的典型示例 , 当用于创建模型的任何特征在预测时不可用或未知时 , 就会发生数据泄漏 。
这对于建立概念的证明是成立的 。 一个正在写论文的研究生肯定会受到开源的保护 。 然而 , 对于企业来说 , 情况有点不同 。
A.开源集成:在几分钟内启动并运行 , 支持多种环境 , 以及透明的版本更新 。
协作:轻松共享数据集、数据连接、代码、模型、环境和部署 。
C.治理和安全:不仅包括数据 , 还包括所有分析资产 。
d.模型管理、部署和再训练 。
F.模型偏见:检测并纠正受性别或年龄而产生偏见的模型 。
E.辅助数据管理:处理用于解决数据科学中最痛苦的任务的可视化工具 。
G.GPU:立即供应和配置以实现深度学习框架的最佳性能 , 例如TensorFlow 。
H.无代码建模:适用于统计人员 , 主题专家 , 甚至是不编码但希望直观地构建模型的高管 。


推荐阅读