有人做过搜索引擎吗,能对Heritrix和Nutch的性能及适用性做个比较分析么

这两个我都用过,都是通用搜索引擎爬虫,Heritrix的可定制性强点,有web管理界面使用起来也蛮方便的,可配置的参数很多,但代码复杂度也蛮高的,二次开发需要读懂他的设计思想。Nutch使用起来就蛮复杂的,一堆的设置,基于命令行的,不利于二次开发。我做的是垂直搜索与数据抓取,这些都不适合,最终还是选择自己开发了一个爬虫,一般来说,我们最终需要的都不是原始的HTML页面。我们需要对爬到的页面进行分析,将感兴趣的数据转化成结构化的数据,并存储下来,这才是爬虫的核心价值。
■网友
目前来说Java版本的是Lucene,一般可以考虑Solr+Lucene来实现分布式的可容灾的一个索引和检索的平台,如果数据量是海量级别,可参考Hadoop+Nutch实现,其他的开源技术框架有,Lily(solr+Hbase+hadoop),zoie(实时搜索引擎),Sphider (Sphider是一个轻量级,采用PHP开发的web spider和搜索引擎)。
■网友
用过NUTCH,但只用过其中的抓取部分,索引部分没有接触。在垂直抓取方面挺容易上手的,而且基于hadoop,稳定性以及易用性都还可以,基本上大数量抓取无忧。后面因为考虑到挖掘上的需要,以及抓取目标不特定,改用自己写的了。


    推荐阅读