诸如百度这些搜索引擎是怎样是识别新词的

有一个系统+人工的维护机制就ok。针对Query log做定期分析,做服务器的监控设置阀值,发现某个词异常了触动介入人工分析,就会发现一大堆类似的词,比如敏感词或者网络热词什么的。这没啥复杂的。
■网友
query log,简单可靠。
■网友
明显是query log呀。
■网友
新词识别是自然语言处理的一个研究方向,就现有论文看来大部分还是统计的方法,先分词再统计,外加少量机器学习方法。


    推荐阅读