在业界,怎样确定模型训练集样本数量样本量过大,有啥好策略
花钱
■网友
越大约好,超了换软件,cpu不行gpu,单机不行上集群
■网友
如果是关联规则挖掘、贝叶斯网络或者其他以“条件概率为基础”的机器学习算法,是有理论可以指导采样的。其他算法,也可以用渐进采样。
-------------------------------
第一部分:“条件概率”类算法(关键词:二项分布,中心极限定理)
此类算法的精度来自于对概率的估计,概率估计得准,则算法准,否则结果就会很烂。那么多少样本合适?对概率的估计精度取决于任意一个事件“在样本中出现的频率”是否和其“出现概率”相近。所以,下面这句话是第一个重点:
重点1:“任意事件的出现概率与其在样本中的频率的差”越小越好!
而样本中,一个事件的出现次数服从二项分布(二项分布的定义)。同时,二项分布在样本规模不是很小很小很小时可视作服从正态分布(基于中心极限定理的二项分布正态近似)。这个分布的期望为np,方差为np(1-p),n为样本规模,p为事件出现的概率。所以,样本中,一个事件出现的频率也可视作服从二项分布。期望为p,方差为p(1-p)/n。再推一步,得到了第二个重点:
重点2:概率和频率的差也服从正态分布,这个分布的期望为0,方差的最大值为0.25/n。n即样本规模
紧接着第三个重点:
重点3:多少样本合适,可以转化为:多少样本可使“频率与概率的差”以99.9%(也可以是其他数,一个你觉得合适的极大概率)的概率控制在之内。
最后,你可以通过调节样本规模n,控制这个正态分布的最大方差,进而使“重点3”成立。
----------------------------
第二部分:其他算法(关键词:Progressive Sampling)
第一步:先随便设置一个样本大小n0,计算n0下的学习结果c0。第二步:增加样本规模至n1,计算c1,计算c1与c0的量化差e1第三步:计算e2第k步:计算e(k-1),e(k-1)是否小于事先设置的阈值?是则退出输出样本规模和结果,否则重复第k步。
一般来说“1-e(k-1)”的曲线变化长成如下这个样子
--------------------
我在下面这个问题答过类似的内容,欢迎一起交流学习
训练一个朴素贝叶斯分类器的训练量应该怎么估计? 【在业界,怎样确定模型训练集样本数量样本量过大,有啥好策略】
■网友
谢邀,
试着回答第一个问题:
数据集大小多少合适, 一般都会说越大越好。对于大的,general purpose 的模型/算法来讲,这应该是对的。
结合我们的实际经验,我们是解决特定应用场景下的问题的,训练数据是否能代表实际应用场景下真实数据的分布是首先要考虑的,先分析应用场景,然后在这一原则下,还要考虑时间成本,采集一定的有效的训练数据。开始训练,同时采集更多的数据。
模型训练结束后,跑验证集,做bias-variance 分析。 然后调整和补充训练数据
简言之,很难一开始就说多少训练数据够用,因为和训练数据的质量和具体要解决的问题有关
试着解答第二个问题:
我们对训练数据的处理,都是自己写的代码,训练数据总量大小,不受内存上限限制,我们训练数据1.5T。 如何处理训练数据,需要好好设计,在内存,存储,计算时间之间做平衡
■网友
脏数据清理掉了以后,当然是数据量越大越好了。可以多研究下训练数据的数据分布,不置信的数据去掉。是否置信这个,也和模型要解决的具体问题相关。
推荐阅读
- 聪明人养花,这3种“花”怎样也要养一盆,每年能省不少医药费
- 筑牢疫情防控“大防线”上海确定三大重点任务
- 互联网怎样解决“家政服务上门速度慢”的问题
- 怎样看待从1月8号起,QQ钱包开始提现收费
- 银行it人怎样转型
- 汽车|冬天怎样让车内温度快速升高?座椅加热的最佳使用方式二,外循环的作用总结
- 怎样进入通信行业
- 怎样评价扶他柠檬茶的小说《云养汉》的结尾
- |龙城高级中学建校地址确定 总用地面积8.24万平
- 怎样成为一名合格的Python程序员?
