简单的Python爬虫问题

1、先说明为啥是None你的getHtml 函数不是用return 返回值,但这样的函数有一个默认返回值为None你print 后,所以输出值为None2、你的正则没有匹配到任何东西,这个你得从抓包上找原因,看图片是不是js生成的。修改好了,可以抓取这一页的jpg图片,其它页面可能需要其它的技术。https://zhuanlan.zhihu.com/p/21704034
■网友
http://www.vip.com/index-ajax.php?act=getCommendMutipleMerchandiseList\u0026amp;bids=799706%2C802585%2C802196%2C802569%2C811575%2C806620%2C797020%2C798323\u0026amp;pagecode=a\u0026amp;_=1469297485268你确定要首页那8个广告的数据,在这个js链接里面,准确的说,在源码里面找到8个广告的数字id,然后根据这个8个id去请求这个json数据.这个链接里面\u0026amp;bids后面的就是,其中%2C是逗号的意思.简单的Python爬虫问题

直接分析这个字典就行简单的Python爬虫问题

8个数字id应该是根据获取这8个class标签后,找到data-id属性就行.子页面的话,以这个恩裳INSUN女装专场为例,用firefox的firebug插件,找到相应的js链接,简单的Python爬虫问题

经过尝试删除参数后,最后简单的json数据链接是http://list.vip.com/index-ajax.php?getPart=getMerchandiseList\u0026amp;r=799706\u0026amp;fromDomain=vip.com用python直接访问者链接就行.简单的Python爬虫问题
【简单的Python爬虫问题】

■网友
getImg方法没有返回值,所以你print他,默认就是None,你不要print,直接调用好了,如果正则表达式没问题,应该能下载图片。


    推荐阅读