抓去下来的html的文件到底是啥格式的

也可以用pyquery或者bs4获取啊。doc.find("a").attr("href")soup.find("a").get("href")如果很多个href是有规律的,当然可以用for了。bs4是for item in find_all("a"): print(item.get("href"))import requestsfrom bs4 import BeautifulSoupdef main(): req = requests.get("http://www.dbmeinv.com/dbgroup/show.htm?cid=6") print(req.encoding) soup = BeautifulSoup(req.text) imgLinks = soup.find_all("div", class_=\u0026#39;img_single\u0026#39;) for link in imgLinks: print(link.find("a").get("href"))if __name__ =="__main__": main()
■网友
有好几种方法可以拿到链接:1,拿到渲染后的源代码后,用查找字符串或者正则表达式清洗出想要的链接。2,xpath获取节点。
■网友
一层层深入抓取,当前抓到这个片段含有href,那么拿href里面的网址再深入一层去抓。不过你给的这个例子的网址是不正确的
■网友
其实就是带标识符的字符串
■网友
你需要一碗汤
■网友
谢邀!你想要的大概就是Beautiful Soup: We called him Tortoise because he taught us.


    推荐阅读