为啥自然语言处理领域不少文章实验数据不用公开的数据集,而用自己的数据集

【为啥自然语言处理领域不少文章实验数据不用公开的数据集,而用自己的数据集】 不知道题主这个说法的依据是什么。有现成可用数据进行验证的情况下还要自己弄数据集,只要不是洞察力特别烂或者姿势水平不够的审稿人来审的话,一般都会提出一定质疑。这样的论文一般很难水过。
不用公开标准数据集的论文做得一般都是非标准任务设定,比如特定领域文本或限定条件下的标注或分析等。一般做正统任务的论文都还是会用标准数据集的,诸如Penn Treebank等有标注树库,或者CoNLL、SemEval、TREC等一堆评测任务都有标准的数据、设定和评价方式。
有些机器学习圈过来插手的研究者稍微做做就知道搞不定一般自然语言,于是不得不尝试受控域或者索性直接重新构造无比简单的数据设定。Memory networks系列早期工作弄的babi数据集就是一个典型例子。通过这样的实验评价所取得的进展多数也很难入得了NLP专业会议审稿人的法眼,所以比较常见的结果是最后送给ICML、NIPS或者ICLR这样的机器学习平台上拿去自嗨……

■网友
据我所知,我们NLP领域做一些传统task一般都用公开数据集,方便与他人比较。楼上说的翻译应该算是个例外。
■网友
翻译圈十分普遍,带坏了ACL的风气。不敢和别人比, 还美其名曰专注中英,实则容易灌水,也不怕被做machine learning的人鄙视


    推荐阅读