搜索引擎怎样对抓取的内容进行分组

感觉楼主有点概念的混乱入索引和分类是两码事入索引就是是分词后的入库。根据ABCD,啊哦额一等一系列term进行存放。分类是把一大堆东西A,去归类的另外几样东西B上。其实本质就是就求A们和某个B的相关性。然后这个相似性又分成布尔模型和潜在语义模型。布尔模型很简单,就是包含(相关)和不包含(不相关)的问题例如你上面的说的东西。各种2元匹配然后布尔模型是有局限性的,太依赖匹配,容易找出太多或者太少的结果。然后接下来就是向量模型把文档中的term映射到向量空间中,然后每个term会有自己的权重,通过余弦求相似性。当然,上面这两个种比较好理解,然后技术实现难度也不大,搜索引擎也不可能用。接下来说说搜索引擎可能会用的(为啥是可能?因为我也不在搜索引擎工作)例如PLSA,LDA等基于统计学语义算法,可以用于分类,过滤,检索等方面,说实话我也搞不太清楚,大概是把文章映射到向量空间中,然后通过奇异值分解后降维进行计算。通俗点来讲,就是例如通过上说的布尔模型模型,可以知道"iphone"和"iphone4s"是同一类东西。但是通过基于统计学的语义算法,能够知道乔布斯和iphone之间是有关系的,具体资料google上查一查吧
■网友
楼上一看就是没有用过司南的。。。实际上搜索引擎至少有非常详尽的站点级别,document级别以及query级别的行业分类。至于搜索引擎是如何实现的,我想说的是这个自动化分类的过程复杂到你不会想知道细节,记得之前zero开的那个seo前线问答网站上有讨论过这个问题,当时印象中只是讨论如何将query分类,光这个都没讨论出个最优方案来。所以我想说的是,还是多发几条外链吧。
■网友
分布式是对的,上方答案所有有违此方式的都是错的
■网友
你的问题比较难以理解,可能你对你想问的问题本来就不太理解,我先帮你指出你问题中的问题。我了解到搜索是蜘蛛先抓取内容到自己的服务器,然后进行分类,后期有用户输入词在进行检索,我现在想了解的是如何放进索引库的(也就是分词)1、蜘蛛抓取内容到搜索引擎的服务器。这个过程没你想得那么简单,我们先不在这里展开。2、分类。搜索引擎这个时候不会进行任何分类。3、分词。分词和分类是两个完全不同的事情。我猜测,你想问的是:搜索引擎抓取到内容后,如何对这些内容进行分类,以放进不同的(跟抓取的内容相关)索引库中。如果我猜对了的话,答案很抱歉,这个时候搜索引擎不会对抓取到的内容进行任何分类。然后你会追问,那搜索引擎是怎么把一篇SEO忽悠的软文归类到SEO这个关键词的索引库的。如果你继续这样追问的话,答案更加抱歉,也根本就没有“归类”“放进”所谓“索引库”这些事情。本来你的问题可以用四个字就是:倒排索引,来给你一个清晰易懂的解答。但是最后一次抱歉,我在百度搜了搜这四个字,劝你还是别看了,写那些文章的人,估计自己也没懂,只好用些小明小黄小花,交集合集集合,数组数列数学来吓唬你这样的初学者。你说搞SEO忽悠的写些软文,大家都理解,就算了。倒排索引,这种名词,都不用人话解释清楚,实在难以理解。另外其他人的回答你就不用看了,他们说的,来源于网上东拼西凑的东西,再加上自己乱七八糟地理解,瞎写一气。他们的答案不是在帮助你,而是他们的一种自我满足。我的答案,虽然也帮不到你,虽然也是我自己的一种自我满足。但,但,我至少没像他们一样害你。
■网友
除了夜息说的LDA什么的,海量数据处理有很多方法,比如并查集Disjoint-set data structure。另,到数据平台、专利网站上搜索「海量数据分类」,可以找到很多资料。
■网友
这东西 一句两句说不清楚!推荐一个视频 (由清华大学博士、副教授唐杰、 搜狗网页搜索产品总监韩异凡(我歧视女性基本可以pass ) 搜狗搜索研究部总监张阔博士 (这个比较不错 ) 演讲)3W公开课(第18课):搜索引擎行业发展趋势——从搜索信息到搜索知识(1)


推荐阅读