关于Python BeautifulSoup解析页面内容丢失的问题
【关于Python BeautifulSoup解析页面内容丢失的问题】 先模拟浏览器响应后,再打开,再用bs的soup解析打开的浏览器界面
这么写:from urllib import requesturl=网址headers1={\u0026#39;User-Agent\u0026#39;:\u0026#39;Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/74.0.3724.8 Safari/537.36\u0026#39;}#自己浏览器的User-Agentget_url = request.Request (url, headers=headers1)open_url = request.urlopen (get_url,timeout=15)soup=BeautifulSoup(open_url,\u0026#39;html.parser\u0026#39;)
■网友
谢邀!看了楼上的回答,已经知道是JavaScript 的问题了,这里我就不重复了,针对JavaScript 动态生成的内容需要进行抓包获取,打开开发人员工具,点击Network ,对页面进行刷新,其中会有你要的数据,然后根据其构建请求,可能是post可能是get,cookie 还有请求的form等都要进行构建,requests包中都有支持的方法,多去试试,不懂来问
■网友
首先把浏览器的Javascript禁用看看页面上的元素是否缺少, 缺少的话就是JS的问题, 和解析器无关.其次, 要出问题也是html.parser 出问题, 特别是在python2中, 出问题的概率很大, 在BS 的官方文档中也提到了这个问题, 所以BS的默认解析器是lxml, 所以, 请用lxml, 安全,稳定
推荐阅读
- 过节■江苏省委省政府办公厅下发关于做好2021年元旦春节期间有关工作的通知
- 怎样成为一名合格的Python程序员?
- |徐州市出台《关于优化创新创业生态系统 提升区域科技创新活力的实施意见》及实施细则
- 雨下|全球关于禁售燃油车只是理论上可行吗
- python 爬虫,咋获得输入验证码之后的搜索结果
- 关于用phpfsocket 写Post, 模拟http 报文怎样写入要传输的处理数据
- 智叔|很多家长还在整箱买:谈谈关于牛奶的17个真相警惕这些列入黑名单的“假牛奶”
- python的html5lib这个库咋使用啊我在网上也没有找到相关文档
- 关于微信小程序的思考:运营者该何去何从
- 关于人工智能虚拟人的一些问题
