为啥自然语言处理领域不少文章实验数据不用公开的数据集,而用自己的数据集
【为啥自然语言处理领域不少文章实验数据不用公开的数据集,而用自己的数据集】 不知道题主这个说法的依据是什么。有现成可用数据进行验证的情况下还要自己弄数据集,只要不是洞察力特别烂或者姿势水平不够的审稿人来审的话,一般都会提出一定质疑。这样的论文一般很难水过。
不用公开标准数据集的论文做得一般都是非标准任务设定,比如特定领域文本或限定条件下的标注或分析等。一般做正统任务的论文都还是会用标准数据集的,诸如Penn Treebank等有标注树库,或者CoNLL、SemEval、TREC等一堆评测任务都有标准的数据、设定和评价方式。
有些机器学习圈过来插手的研究者稍微做做就知道搞不定一般自然语言,于是不得不尝试受控域或者索性直接重新构造无比简单的数据设定。Memory networks系列早期工作弄的babi数据集就是一个典型例子。通过这样的实验评价所取得的进展多数也很难入得了NLP专业会议审稿人的法眼,所以比较常见的结果是最后送给ICML、NIPS或者ICLR这样的机器学习平台上拿去自嗨……
■网友
据我所知,我们NLP领域做一些传统task一般都用公开数据集,方便与他人比较。楼上说的翻译应该算是个例外。
■网友
翻译圈十分普遍,带坏了ACL的风气。不敢和别人比, 还美其名曰专注中英,实则容易灌水,也不怕被做machine learning的人鄙视
推荐阅读
- 济南垃圾处理单位“前分后混”将面临最高十万元罚款
- 为啥看到书柜上的藏书会有心旷神怡的感觉
- 为啥知乎上普便有一种【我在北上广深打工,所以拥有更好的视野】这样的错觉
- 为啥工商银行的用户体验如此之差
- 汽车|看了中消协4S店服务测评调查结果,终于知道法系车为啥卖不好了
- 汽车知识|捷达库存成灾,特价处理,4S店卖不动,大家都不差钱!
- 你为啥从窝窝商城离职?
- 想要入门图像处理,应该从哪本书看起
- 为啥5G和2.4G默认的BSSID是相同的
- 学图像处理有哪些不错的书推荐
