nlp实体关系提取中怎样构造特征向量

谢邀。其实我不太明白题主的描述,那我大概说说一般流程了。但要注意,做这个没有金科玉律,一切取决于问题和数据本身。要把文档变成数值矢量,先把文档分词,英文有大量tokenizer,中文也有jieba一类的segmentator。然后移除stop words。然后建一个词项文本矩阵,矩阵数值由词项的出现频率而定,一般会加上tf-idf权重。这个流程一般可以用numpy、nltk和gensim等Python包完全处理。用这个矩阵,任何新进来的文档都可以用这个矩阵化成矢量。一般课本都会谈这个问题,如Chris Manning及Hinrich Schütze的《Foundations of Statistical Natural Language Processing》(Foundations of Statistical Natural Language Processing)。另外一个方法是用Word2Vec和Doc2Vec,直接用他们提供的模型把每一字变成矢量,加起来。课情参看Michael Czerny的博文《Modern Methods for Sentiment Analysis》(District Data Labs)。
■网友
你能确保你的词性标注完全正确吗,否则没必要标注词性,好的词典+word embedding就行。前后两个窗口还是太小,最好构建大窗口,或者在足够语料情况下用rnn,实践中还要考虑长短句问题
■网友
【nlp实体关系提取中怎样构造特征向量】 题主解决这个问题了吗?我最近也是僵在这里了,比如两个实体之间的词,如何转化特征向量?

■网友
词的话要怎么转换呢?同词性这个我没看懂是如何转换的,构造出的特征是不是会有很多0然后一个1?是比如tfidf 以py为例 遍历一遍 建个dict (或者defaultdict)分别count就行了有了dict 你把keys分别map到0-n就把一串词语变成一串数字了 你可以数字直接对应到embedding或者生成onehot
■网友
很简单 每个位置上的词袋 所以surdeanu的特征最后有几十万维


    推荐阅读