怎样爬取不同网站的信息,有通用的方法来抓取正文吗,难道要针对这些不同的网站来写不同的正则或xpath?

https://github.com/buriy/python-readability
■网友
一般情况下层数最深的\u0026lt;div\u0026gt;就是正文,试下这个思路。
■网友
【怎样爬取不同网站的信息,有通用的方法来抓取正文吗,难道要针对这些不同的网站来写不同的正则或xpath?】 如果爬取正文是不是可以从文字密度方面入手,这样会不会爬取到不想爬取的地方?

■网友


    推荐阅读