我们以内容页网址 http://kimi201406.1688.com/page/creditdetail.htm 为例,来获取它的公司介绍和联系方式页面的联系方式信息。
    公司介绍在网址 http://kimi201406.1688.com/page/creditdetail.htm 里获取,而联系方式信息在网址http://kimi201406.1688.com/page/contactinfo.htm 里获取。所以我们需要借助多页功能来实现。前者叫默认页地址,后者叫做多页地址。

流程:点击①创建多页,进行②多页设置,然后在数据来源③选择多页调用,最后根据多页源代码设置提取方式。

下面重点讲解②,多页地址的两种获取方式:页面地址替换和源码中截取。

1.页面地址替换:也就是默认页和多页地址有相同的地方,通过简单的替换就可以变成多页地址。

比较默认页“http://kimi201406.1688.com/page/creditdetail.htm”和多页地址:“http: //kimi201406.1688.com/page/contactinfo.htm”之间的共同点,可以发现默认页“creditdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。

设置如下图:

注:正则表达式中 (.*) 为任意通配符。$1,$2…$数字来按照顺序对应上面(.*)表示的部分。若要对多页源码部分区域做限定,可在指定多页源码区域设置。
若留空则默认返回多页整个源代码。设置好以后,点击测试查看结果即可。
2.源码中截取:也就是多页的地址在默认页的页面源代码里面。
如图,可以看到默认页源码中存在多页地址。

所以设置如下:
测试后如正确则保存即可。最后设置数据来源和提取方式,如图:
 
注:如需要多级多页,则在多页地址获取方式选择需要的多页即可
  这两种获取方式大家掌握了吗,今后在抓取网站时使用火车采集器V9的上述操作就可以很容易地获取到关联的多页地址了,作为一款功能全面的网站抓取精灵,火车采集器一定会充分考虑到用户的使用需求,以及如何最大化实现便利

火车采集器采集多页内容的抓取方法相关推荐

  1. 小程序数据证明采集_微信小程序内容数据采集抓取爬虫

    微信小程序公众号订阅号,历史热门文章内容,留言阅读数量点赞数量等数据都可以采集抓取,怎样做?方法会很难吗?给你几个微信公众号爬虫,微信数据采集爬取so easy! 1.基于搜狗微信搜索的微信公众号爬虫 ...

  2. python多线程url采集器 + github_利用Python3.5多线程抓取妹子图

    很久之前就写了这个爬妹子图的Python爬虫,并且开源到Github上,然而居然没有人给小心心,虽然现在失效了,妹子图网站开启了反爬虫机制,但还是可以作为大家学习的样例,注释也很清晰. 0x01 起因 ...

  3. 火车头采集器 采集https网站 以及网站cookie 避免 蜘蛛 爬虫 程序等

    火车头采集器 采集https网站 并不是想象中的困难,有时https网站只是用了这个加密协议,但是事实上的数据并没有加密,所以仍然可以采集. 如果确实有困难的可以通过,http分析软件来确认地址,如H ...

  4. cmsplus实战之仿[我扫网]之十一:安装采集器采集并发布数据

    一:安装火车头采集器: 二:导出栏目信息到采集器: 三:配置火车头采集器采集数据并发布:

  5. PHP PDF内容识别 抓取信息 方法

    PHP PDF内容识别 抓取信息 方法 PDF Parser 使用 PDF Parser 参考:http://www.pdfparser.org/ (注意:composer.json 更新 pdfpa ...

  6. php抓取标签内的内容,php抓取网页中的内容

    以下就是几种常用的用php抓取网页中的内容的方法. 1.file_get_contents PHP代码 代码如下:>>>>>>>>>>> ...

  7. 飞飞php2.8采集失败_飞飞影视系统火车头采集器采集发布免登录接口

    更改完免登陆代码后,就要写采集库接口了,打开\Lib\Action\Admin目录下的CollectAction.class.php文件,添加一个子函数,函数名称和第五步中的代码相同 //处理 火车头 ...

  8. 《火车头采集器采集网页数据》火车头配置规则采集信息文章数据。

    此为火车头采集器的页面 *左边建立分组,建议结构都和所需要采集的数据结构一致,不然数据多了起来,很容易混乱. 1, 创建任务 起始网址是指你需要抓取的网址,例如:http://www.day.gov. ...

  9. 火车头采集器采集图片文章详细 教程

    火车头采集器怎么采集带图片文章?首先要更好的使用火车头采集器软件,必须需要有基本的HTML基础,能看得懂网页源码,网页结构. 同时如果用到web发布或数据库发布,则对自己文章系统及数据存储结构要非常了 ...

  10. html 抓取移动,网页采集提取数据教程,以自定义抓取方式为例 - 八爪鱼采集器...

    网页上的数据类型十分丰富:文本.图片.链接.源码等.在数据采集过程中,不同类型的数据类型,对应的抓取方式是不同的.本文将讲解常见的数据类型与其抓取方式. 示例网址:https://movie.doub ...

最新文章

  1. Android平台使用PocketSphinx做离线语音识别,小范围语音99%识别率
  2. 是啥意思_227大团结是什么梗啥意思 微博227大团结事件始末介绍
  3. sougou ubuntu 优麒麟_优麒麟(Ubuntu Kylin)17.04 正式版及银河麒麟社区版发布
  4. 企业日志分析ELK(Logstash+Elasticsearch+Kibana)介绍及搭建
  5. java .jvp文件_GitHub - eddylapis/jvppeteer: Headless Chrome For Java (Java 爬虫)
  6. 商汤校招 | 春笋计划”
  7. 【Elasticsearch】Elasticsearch-Hadoop打通Elasticsearch和Hadoop
  8. Atitit 编程语言知识点tech tree v2 attilax大总结
  9. PDF文档编辑Acrobat Pro DC
  10. zblog php修改代码,zblog模板建站新上线必须修改的优化代码
  11. 各个电脑品牌BIOS快捷启动热键
  12. 【Cocos2D-X 游戏引擎】初窥门径(4)Touch 事件:移动精灵
  13. 视频剪辑用计算机,用于视频剪辑的笔记本电脑,我们都有哪些选择
  14. Python math.fabs() 方法
  15. python编程入门必读书籍排行榜_【亲测】很的python数据分析书分享
  16. 为什么要用Modbus转MQTT网关?
  17. SurfaceView 使用demo 飞机游戏小样
  18. python怎么画地图空间分异图_基于地形梯度的赣南地区生态系统服务价值对人为干扰的空间响应...
  19. 2020ACM俱乐部后备营个人训练赛第七、八、九场
  20. 今夕何夕 HDU - 6112 ( 模拟 )

热门文章

  1. Java 初中级程序员如何快速成长?
  2. 权限控制-@Secured注解
  3. agent常见处理问题的处理
  4. html批量替换不同关键词,JS批量替换内容中关键词为超链接
  5. UE4-(蓝图)第一百二十课 贴花(蓝图生成示例开枪生成弹孔)
  6. scikit-learn 线性回归算法
  7. 如何安装TFP(tensorflow概率编程)
  8. leetcode 376. 摆动序列(三种解法)
  9. IE11兼容ES6语法问题
  10. 自动删除微博【新版微博】