抓去下来的html的文件到底是啥格式的
也可以用pyquery或者bs4获取啊。doc.find("a").attr("href")soup.find("a").get("href")如果很多个href是有规律的,当然可以用for了。bs4是for item in find_all("a"): print(item.get("href"))import requestsfrom bs4 import BeautifulSoupdef main(): req = requests.get("http://www.dbmeinv.com/dbgroup/show.htm?cid=6") print(req.encoding) soup = BeautifulSoup(req.text) imgLinks = soup.find_all("div", class_=\u0026#39;img_single\u0026#39;) for link in imgLinks: print(link.find("a").get("href"))if __name__ =="__main__": main()
■网友
有好几种方法可以拿到链接:1,拿到渲染后的源代码后,用查找字符串或者正则表达式清洗出想要的链接。2,xpath获取节点。
■网友
一层层深入抓取,当前抓到这个片段含有href,那么拿href里面的网址再深入一层去抓。不过你给的这个例子的网址是不正确的
■网友
其实就是带标识符的字符串
■网友
你需要一碗汤
■网友
谢邀!你想要的大概就是Beautiful Soup: We called him Tortoise because he taught us.
推荐阅读
- 现在在线学习视频有很多了,为啥大部分人还是喜欢下载下来观看
- 女子抱着3岁孩子在杭州一派出所门口哭喊:快救救我儿子!接下来的7分钟……
- 多云|直逼零度!南通接下来……
- python的html5lib这个库咋使用啊我在网上也没有找到相关文档
- 趣头条|现代飞思换奔驰E200L 改装的脚步停不下来
- 宝宝|这3类食物,孕妇再馋也要管住嘴!不想孩子生下来有“黄疸”
- 我现在在学c语言,然后以后的工作目标是腾讯网易这些游戏公司,我是通信专业,请问我接下来再该学些啥呢
- 为啥我无法保存一个网页的完整html文件
- 入游戏开发坑一年,迷茫中,应该选择原生app游戏还是web html5游戏还是3d重度游戏,未来是何
- HTML这么原始的页面展现方式为何没有新技术彻底替换它
