甜野猫 关于机器学习那些事儿:我们从企业学到哪些经验教训?
点击上方关注 , AllinAI中国
“假设你有一个具有某些特征的数据集 , 目的是预测某个变量 , 你会做什么?”
令我沮丧的是 , 他们的答案往往是这样的:
“我将数据集拆分为训练/测试 , 运行Logistic回归、随机森林、SVM、深度学习、XGBoost......(以及一些闻所未闻的算法) , 然后计算精度、召回率、F1得分 , ...(以及一些闻所未闻的指标) , 最终选择最佳模型” 。
但是 , 我问他们:
“你有没看过这些数据?如果您缺少值 , 该怎么办?如果您的错误值/错误数据怎么办?您如何映射分类变量?你是如何做特色工程的?”
在本文中 , 我将介绍成功创建端到端机器学习系统所需的七个步骤 , 包括数据收集、数据管理、数据探索、特征提取、模型训练、评估和部署 。
1.给我一些数据!
尽管如此 , 我们需要区分原始数据(即 , 可能与手头问题无关的所有部分)和特征集(即ML算法的输入矩阵) 。 从原始数据转到功能集的过程称为数据准备 , 通常包括:丢弃无效/不完整/脏数据 , 根据我们的经验 , 这些数据可能达到记录的一半 。 聚合一个或多个数据集 , 包括联接和组聚合器等操作 。 特征选择/提取 , 例如 , 移除可能不相关的特征 , 例如唯一ID , 并应用其他降维技术 , 例如主成分分析(PCA) 。 使用稀疏数据表示或特征哈希来减少具有许多零值的数据集的内存占用 。
推荐阅读
- 上海市科学技术委员会|关于做好制订因公出国(境)培训中期规划的补充通知
- 新华网|各显神通的“机器伙伴”
- 上海市教育委员会网站|关于转发《上海市幼儿园办园质量评价指南(试行稿)》的通知
- 机器人病毒检测、无人机送快递……来看2020服贸会服务机器人展区的智能高科技
- 顺园谈历史|吕不韦是秦始皇的生父吗?这传闻如何而来?
- 餐宝典|餐饮业十大发展趋势:洗牌、资本、供应链、机器人……
- LeoGo科技|科沃斯除菌地宝N8和米家扫拖机器人横评——两款解放双手的精品
- 中国历史上发生的疫情|中国历史上发生的疫情?中国历史上发生的疫情:中国历代发生大的疫灾
- 机器人:温柔可爱软妹子X优雅迷人贵公子
- 「机器人」优必选机器人Walker浇花踢球 视觉技术再升级
