怎样爬取不同网站的信息,有通用的方法来抓取正文吗,难道要针对这些不同的网站来写不同的正则或xpath?
https://github.com/buriy/python-readability
■网友
一般情况下层数最深的\u0026lt;div\u0026gt;就是正文,试下这个思路。
■网友
【怎样爬取不同网站的信息,有通用的方法来抓取正文吗,难道要针对这些不同的网站来写不同的正则或xpath?】 如果爬取正文是不是可以从文字密度方面入手,这样会不会爬取到不想爬取的地方?
■网友
是
推荐阅读
- 聪明人养花,这3种“花”怎样也要养一盆,每年能省不少医药费
- 互联网怎样解决“家政服务上门速度慢”的问题
- 怎样看待从1月8号起,QQ钱包开始提现收费
- 银行it人怎样转型
- 汽车|冬天怎样让车内温度快速升高?座椅加热的最佳使用方式二,外循环的作用总结
- 怎样进入通信行业
- 怎样评价扶他柠檬茶的小说《云养汉》的结尾
- 趣头条|【为什么300万人都选帝豪GL】因为有你,每个周末都与众不同
- 概念车|历久弥新 与众不同-B级家轿 英诗派
- 陆毅|三部大戏相继开播“观众缘”各不同
