机器学习咋才能知道我的模型已经最优了
谢邀。
标题和正文说的是两个问题,我先回答标题的问题,“实践是检验真理的唯一标准”
■网友
谢邀。
先就题主说的情况讨论下。首先随机数据与随机标签生成的伪样本在特征工程阶段都不会通过,更别说建模型的事情了。首先要清楚做模型的步骤,在数据进入模型之前有非常重要的特征工程阶段,其中就包括了变量的IV、WOE、Pearson相关系数等各类变量相关性、变量信息度检验等操作,随机数据是不可能通过这一检验步骤的,这一步就能看到哪些变量对target的区分效果最好,哪些最差,随机数据的IV值肯定都不rank,这种特征也不可能用来跑模型。
其次,更加通用地来说,如果按照严格的模型开发流程,从特征构造、检验,再到模型构建,任何一部都能检验出是不是数据的问题。如果在特征工程阶段检验处特征合理,最后跑模型一般不会很差。如果模型还是很差,就要去看到底是数据不够,还是特征过少,还是模型太简单。
【机器学习咋才能知道我的模型已经最优了】 还有一种最常见的情况就是数据分布不一致导致评估出现很大误差。我在之前遇到过类似的问题,train和dev是来源于同分布,而test分布完全变了,这时候训练出模型对test很差,这种完全可以在数据处理阶段发现是数据出问题了,而不是模型。
■网友
就是 ,我什么时候可以告诉领导,是数据不好的锅,不是我水平不够训练不出好模型。
推荐阅读
- 三角梅冬天有“四怕”,避开了才能安全越冬,来年疯狂开花不停歇!
- 现在在线学习视频有很多了,为啥大部分人还是喜欢下载下来观看
- 婴儿|美国儿科学会: 1岁以下婴儿不推荐学习游泳
- 电话营销机器人哪个比较好用
- 在美国大学学习computer science 是啥样的体验
- 请问有哪些机器人大赛是比较权威的
- 作为一个服装供应商,怎么样与淘宝卖家沟通才能卖出自己的产品或者拿到订单
- 作为软件工程大二的学生,学习一般,编程一般,毕业后能干些啥
- 计算机深度学习方面sci三区期刊推荐
- 零基础入门学习啥语言好
