kaggle的泰坦尼克生存分析竞赛,为啥很多人预测正确率达到了惊人的100%

作弊了。
因为这个数据是可以查到的,所以直接通过暴力方法,可以hack出真实值。但是这个比赛是入门性质,并不是真正奖学金的比赛。所以没有特别的惩处。一般超过90%的准确率会有作弊成分。

■网友
最近邀请有点多啊,严重怀疑某个指标触发了设的阈值。
=====================分割线=======================
说实话,没搞过kaggle,针对这个问题说不出个所以然来,我说一些通用的东西。
一般来说预测效果取决于以下几个方面:
kaggle的泰坦尼克生存分析竞赛,为啥很多人预测正确率达到了惊人的100%

#1 研究对象本身的可预测性
有些事情本身不好预测,比如股票;有些事情是服从“预测不准原理”的,尤其是跟人打交道的事情,预测会改变人的行为;而有些事情就相对好预测,比如图像识别,语音识别已经达到实用阶段。
#2 数据
数据决定了效果的上限,有多少东西可以学
#3 模型capacity
模型的学习/表达能力,能学多少
#4 trainability
可训练性,这是一个优化问题,能不能找到一个“好”的解;很多模型架构的表达能力都是同等的,性能上的差异都是由于某些结构比其他架构更容易优化导致的。

详情在这里:机器学习模型设计五要素



■网友
给你一千个人,看喉结几乎 100% 能分出男女。
严重怀疑,参赛模型自动学到了,这样的必然规则。
机器学习不能100%正确,这个论断是不对的。
只是大部分能直接判断的场景被我们用规则或者人类判断做了,不会用机器学习技术而已。只有在不能直接判断的问题,我们才用机器学习。久而久之,大家产生了机器学习不能100%正确的印象

■网友
明显的过拟合,入门级的MNIST数据集,做到100%也不是难事,但是ImageNet以及更大的数据集(百度某年度在ImageNet也多次提交测试),过拟合就不容易了

■网友
有真实生还数据,可以作弊。

■网友
谢邀。不好意思,这不清楚,没有了解过。
■网友
我觉得你可能根本就不了解ML的基础知识。
第一,
即使train出来的模型效果贼好,也不代表其泛化性能强。
验证集100%准确率首先就是一种过拟合渗透。
测试集我就先不提直接作弊,就存在通过无数次提交来把过拟合渗透到测试集这种方法(baidu在去年imagenet上的刷sota方法)
第二,
即使没有这种过拟合渗透,测试集是真实世界的采样。测试集对应真实空间依然存在采样出的分布能以何种程度代表真实分布的问题。
封闭数据集非无偏估计。也就是你在数据集上的结果的期望并不代表对应问题的期望。所以你的问题从根本上就没什么意思。
很多人达到测试集100% 推不出他们的算法 就能解决这个问题:
“光靠特征工程和算法,就算袁天罡刘伯温再世,告诉他姓名年龄船票多钱在哪上船,也不能100%的预测到你坐船会沉吧,真成神了?”
【kaggle的泰坦尼克生存分析竞赛,为啥很多人预测正确率达到了惊人的100%】 所以本来就没可能有这个结论存在。。。除非测试集是连续无穷的,然而在计算机科学中不存在。更别提泰坦尼克号这种入门试水的小数据集了。


    推荐阅读