咋提取网页输入字符后下拉框的文本数据
我把这种抓取称为输入联想的抓取,应用还是很广泛的,比如,分析搜索引擎的联想词。当输入一个字符或者按了enter键或者焦点移走了,都会发送一些事件,网页上的javascript代码会根据这些事件实现联想词的显示。最直接的抓取方法是模拟人的输入行为,这样可以避免用抓包工具去解析联想词的展示过程,抓包以后还要模拟,整个过程对技术要求很强,也很费时间。模拟人的操作就需要网络爬虫具有javascript的解析运行能力,比如,用Python webdriver驱动chrome或者火狐。可以做一些很细的事件模拟,比如,input事件,change事件和焦点事件。有些网页会有很细致的机器人识别,那么就要很细致地模拟真人。具体可以看我的专栏
■网友
还记得浏览器F12么?打开看看。

■网友
用不同的工具有不同的获取方法,这个数据应该是ajax加载的,也就是你输入之后,网站会从后台查询相关地点数据,然后展示。如果用八爪鱼采集气的话,需要做两个步骤,一个步骤是输入,然后第二个步骤是提取列表的数据,当然输入之后,执行提取的时候最好设置等待2秒左右,以确保下拉的列表数据加载出来后再采集。
■网友
使用爬虫软件抓取这种下拉联想的内容,操作步骤基本都是分为两步的,第一步就是在输入框做输入,等下拉联想框的内容完全展示,第二步就是获取下拉联想框的内容,其实用爬虫软件挺容易弄的
■网友
http://www.infodriveindia.com/traderesources/port.aspx
【咋提取网页输入字符后下拉框的文本数据】
这个网站里面,输入海港代号的首字母,按照顺序排列,我随机抽取了几个代码与bigschedules 网站的对比,发现都可以对上,除了一个海港编号是bigschedules 上没有的,所以初步觉得这个网站上的港口数据比bigschedules 的要要多,而且asp的页面可以直接在excel中导入港口信息数据。这样拿到港点数据库,是一个比较笨的办法 之前有在我大天朝的港口信息查询网址搜过,5个里面有两个编码对不上,就没用了。拿到数据库后,我想通过自己写个小程序,批量的地点,发送给bigschedules 网站,得到路线信息,然后导出,有大神有高见吗?
■网友
泻药,占坑慢答感觉亲的爬取策略没选对,我没搞清楚需求是什么
推荐阅读
- 江苏■1月4日江苏新增境外输入新冠肺炎确诊病例1例
- 李兰娟:国外疫情持续蔓延,严防输入是当下最重要任务
- 重庆彭水县境外输入无症状感染者的密接者均为阴性
- 病例■连云港通报8日新增1例境外输入新冠肺炎确诊病例详情
- 江苏■12月8日江苏新增境外输入新冠肺炎确诊病例1例
- 广州同一入境航班检出2例输入性恶性疟个案
- python 爬虫,咋获得输入验证码之后的搜索结果
- 广东新增确诊病例3例、无症状感染者1例,均为境外输入
- PS网页版
- 网页设计和嵌入式哪个发展好一点?
