用爬虫来采集很多不同网站中同种类内容,有啥方案 ?

每个网站写一个采集模式很复杂吗……?
验证分析一下XPATH,最慢一个网站十分钟总能搞定了吧?
如果复杂点加上前处理后处理,半小时一个站的配置肯定绰绰有余了。
把爬虫写成策略和机制分离的模式,一个网站一个conf,每个网站要填的就几个参数而已。
如果不这么弄,可以考虑直接用正则表达式抓关键词然后在上下文捕获大段文字。
基本也能看,但肯定比专门为网站写的配置效果差多了。
或者有兴趣你可以考虑研究一下如何自动分析文档结构,用数据挖掘机器学习方法来把写conf的事也省了。

■网友
不同人写的网站有时候差别很大,不同网站还是别写通用的了,最后为了通用一堆if else,还不如一个一个分析呢,真心的
■网友
最简单有效的方法就是一个个站点去分析,在分析清楚后才可能有优化方案。爬虫代码只会执行你告诉清楚的动作。
■网友
建议使用八爪鱼采集器完成此需求。
题主也很清楚,由于html结构不同,一个规则是无法匹配全部网站的,针对每个网站做采集规则才会精准采集。而使用八爪鱼,只需输入网址,再点击操作几下,即可轻松配置一个采集规则,不需要花时间编程,几十个政府网站的规则在很短时间就可以配置完成,操作简单, 效率也极高。
作为一款功能强大的采集神器, 八爪鱼还支持定时采集功能, 可同时对各大网站的最新公告数据实时采集,实时入库,全自动化操作,有效节约人力。
给有需要的朋友附上八爪鱼的下载链接:
免费下载 - 八爪鱼采集器


■网友
你可以问下前嗅的客服,上次他们跟我说,现在可以批量配置网站

■网友
【用爬虫来采集很多不同网站中同种类内容,有啥方案 ?】 建议使用瑞雪采集云进行采集,这个平台很方便。

瑞雪采集云第一个支持java和python的企业级的开发平台。

瑞雪采集云的特点:

1. 支持java和python

2. 采集效率高

3. 分布式

4. 任务管理机制强大

5. 部署简单易用

6. 自动学习机制

7,费用低

http://web2data.com

■网友
这种站最好还是一个站一个站去分析吧~
对于采集政府网站,可以使用已有的采集器,因为政府网站的架构不算复杂,用Octoparse采集器可以直接通过点击来完成crawler的构建,不需要写复杂的代码,简单快速。

■网友
蜘蛛程序的最大特点就是采集规则,统一写采集规则是不现实的事情,除非他们都是同一个模版
■网友
scrapy爬虫,解决静态网站没问题,动态的不行,如果是政府公告的应该没问题,主要是找Xpath
■网友
用众大云采集,里面有一个功能叫“网址采集”,只要输入网址,就会自动分析出标题和内容,很方便。


    推荐阅读