甜野猫 关于机器学习那些事儿:我们从企业学到哪些经验教训?( 三 )
自动编码器一类分类算法 , 如一类SVM置信区间聚类使用过采样和欠采样进行分类6.数据往往不平衡
TP=正确预测为正数的实例总数
TN=正确预测为负数的实例总数
FP=错误预测为正数的实例总数
FN=错误预测为负数的实例总数
【甜野猫 关于机器学习那些事儿:我们从企业学到哪些经验教训?】在典型的异常检测场景中 , 我们的目标是最小化假阴性-例如 , 忽略欺诈性交易 , 不识别有缺陷的芯片 , 或者将病人诊断为健康-同时不会产生大量的假阳性 。
精度=TP/(TP+FP)
召回=TP/(TP+FN)
注意精度会惩罚FP , 而召回惩罚FN 。 一个从未预测欺诈的模型将具有零召回和未定义的精度 。 相反 , 总是预测欺诈的模型将具有100%的召回率 , 但由于大量的假阳性 , 其精确度非常低 。
我强烈反对在异常检测中使用接收器操作特性(ROC)曲线 。 这是因为ROC曲线依赖的假阳性率(FPR)受到数据集中负面实例(即FP+TN)数量的严重偏差 , 即使存在大量的FP , 导致可能很小的FPR 。
FPR=FP/(FP+TN)
相反 , 错误发现率(FDR)有助于更好地理解FP在异常检测模型中的影响:
FDR=1-精度=FP/(TP+FP)
7.不要预测 。 告诉我为什么!我遇到过几个项目 , 其目标不是创建一个模型来实时进行预测 , 而是解释一个假设或分析哪些因素解释某种行为-这是为了采取一些盐 , 鉴于大多数机器学习算法都是基于相关性而非因果关系 。 一些例子是:
哪些因素会使患者陷入高风险?哪种药物对血液检测结果的影响最大?哪个保险计划参数值最大化?客户的哪些特征使他更容易犯罪?churner的概况是什么?解决这些问题的一种方法是计算特征重要性 , 该特征重要性由随机森林、决策树和XGBoost等算法给出 。 此外 , LIME或SHAP等算法有助于解释模型和预测 , 即使它们来自神经网络或其他“黑盒”模型 。
8.调整超参数机器学习算法具有参数和超参数 。 它们的不同之处在于前者是由算法直接估计的-例如 , 回归系数或神经网络的权重-而后者不是由使用者设定 , 而是需要由用户设置-例如 , 随机森林、神经网络中的正则化方法 , 或支持向量机(SVM)分类器的核函数 。
为ML模型设置正确的超参数值可以产生巨大的差异 。 例如 , SVM的线性内核将无法对不可线性分离的数据进行分类 。 如果最大深度或分割数量设置得太高 , 则基于树的分类器可能过度拟合 , 或者如果它们的最大特征数量设置得太低则可能不合适 。
找到超参数的最佳值是一个非常复杂的优化问题 。 以下是一些建议:
了解超参数的优先级 。 在随机森林中 , 树木的数量和最大深度可能是最相关的 , 而对于深度学习 , 可以优先考虑学习速率和层数 。 使用搜索策略:网格搜索或随机搜索 。 后者是优选的 。 使用交叉验证:设置单独的测试集 , 将剩余数据分成k个折叠 , 并使用每个折叠迭代k次以进行验证(即 , 调整超参数) , 剩余的用于训练 。 最后 , 计算所有折叠的平均质量指标 。 9.深度学习:灵丹妙药?在过去几年中 , 深度学习一直是研究和产业发展的重点 。 TensorFlow、Keras和Caffe等框架现在可以通过高级API快速实现复杂的神经网络 。 应用程序是无数的 , 包括计算机视觉、聊天机器人、自动驾驶汽车、机器翻译 , 甚至游戏-击败世界上最顶尖的围棋和国际象棋电脑
推荐阅读
- 上海市科学技术委员会|关于做好制订因公出国(境)培训中期规划的补充通知
- 新华网|各显神通的“机器伙伴”
- 上海市教育委员会网站|关于转发《上海市幼儿园办园质量评价指南(试行稿)》的通知
- 机器人病毒检测、无人机送快递……来看2020服贸会服务机器人展区的智能高科技
- 顺园谈历史|吕不韦是秦始皇的生父吗?这传闻如何而来?
- 餐宝典|餐饮业十大发展趋势:洗牌、资本、供应链、机器人……
- LeoGo科技|科沃斯除菌地宝N8和米家扫拖机器人横评——两款解放双手的精品
- 中国历史上发生的疫情|中国历史上发生的疫情?中国历史上发生的疫情:中国历代发生大的疫灾
- 机器人:温柔可爱软妹子X优雅迷人贵公子
- 「机器人」优必选机器人Walker浇花踢球 视觉技术再升级
