python怎样实现批量抓取某一网站全部文章的链接

试试Scrapy | A Fast and Powerful Scraping and Web Crawling Framework,简单配置一下。
■网友
这个需要具体问题具体分析,题主有地址吗?抓取本质无非:识别资源所在url -\u0026gt; 访问该url并带上该带的数据,必要时伪装下头部。 比如你要抓当前页面下“相关问题”的所有内容,可以通过pat = re.compile(\u0026#39;\u0026lt;li itemprop="itemListElement"(.*?)\u0026lt;/li\u0026gt;\u0026#39;,re.DOTALL)这个正则表达式获得所有的url,然后分析并产生正确的url,最后访问url获得内容,再自己提取出来便是。总之,你要做爬虫,要问自己这几个问题:0、我要抓取什么内容?1、这些内容页面的地址是什么?我如何获取地址?需要post数据吗?我如何获取需要post的数据?2、在获得候选数据后,我如何筛选出我想要的内容?
■网友
scrapy可以啊也可以试试这个简单有效的工具 【python怎样实现批量抓取某一网站全部文章的链接】 python怎样实现批量抓取某一网站全部文章的链接

下载地址:http://d.shop123.io/tongyong/caijiqi.zip?hmsr=%E7%9F%A5%E4%B9%8E\u0026amp;hmpl=%E7%9F%A5%E4%B9%8E\u0026amp;hmcu=%E7%9F%A5%E4%B9%8E\u0026amp;hmkw=%E7%9F%A5%E4%B9%8E\u0026amp;hmci=%E7%9F%A5%E4%B9%8E
■网友
找到他文章的列表页,有时可能会有多种
然后按照列表页,一页一页爬下去


■网友
使用requests下载html,然后用lxml或beautiful soup解析提取链接
■网友
python 我不是很熟、、看你需求好像就是一个爬虫呗、、


    推荐阅读