python怎样实现批量抓取某一网站全部文章的链接
试试Scrapy | A Fast and Powerful Scraping and Web Crawling Framework,简单配置一下。
■网友
这个需要具体问题具体分析,题主有地址吗?抓取本质无非:识别资源所在url -\u0026gt; 访问该url并带上该带的数据,必要时伪装下头部。 比如你要抓当前页面下“相关问题”的所有内容,可以通过pat = re.compile(\u0026#39;\u0026lt;li itemprop="itemListElement"(.*?)\u0026lt;/li\u0026gt;\u0026#39;,re.DOTALL)这个正则表达式获得所有的url,然后分析并产生正确的url,最后访问url获得内容,再自己提取出来便是。总之,你要做爬虫,要问自己这几个问题:0、我要抓取什么内容?1、这些内容页面的地址是什么?我如何获取地址?需要post数据吗?我如何获取需要post的数据?2、在获得候选数据后,我如何筛选出我想要的内容?
■网友
scrapy可以啊也可以试试这个简单有效的工具 【python怎样实现批量抓取某一网站全部文章的链接】 
下载地址:http://d.shop123.io/tongyong/caijiqi.zip?hmsr=%E7%9F%A5%E4%B9%8E\u0026amp;hmpl=%E7%9F%A5%E4%B9%8E\u0026amp;hmcu=%E7%9F%A5%E4%B9%8E\u0026amp;hmkw=%E7%9F%A5%E4%B9%8E\u0026amp;hmci=%E7%9F%A5%E4%B9%8E
■网友
找到他文章的列表页,有时可能会有多种
然后按照列表页,一页一页爬下去
■网友
使用requests下载html,然后用lxml或beautiful soup解析提取链接
■网友
python 我不是很熟、、看你需求好像就是一个爬虫呗、、
推荐阅读
- 聪明人养花,这3种“花”怎样也要养一盆,每年能省不少医药费
- 北京22家市属医院均开展安检基本实现重点区域安检措施全覆盖
- 长江流域渔民退捕“上岸”实现扩产新致富
- 实现“甜蜜计划”,这对中哈跨国夫妻好甜
- 北京地铁11号线西段三座车站提前实现主体结构封顶
- 互联网怎样解决“家政服务上门速度慢”的问题
- 怎样看待从1月8号起,QQ钱包开始提现收费
- 银行it人怎样转型
- 汽车|冬天怎样让车内温度快速升高?座椅加热的最佳使用方式二,外循环的作用总结
- 怎样进入通信行业
