python多级网址爬取_火车头多级网址采集-入库一键更新实例

前言,以下采集只供学习使用我和这个站长也没仇,只是随便找的一个站做为测试使用。下面开始,我们以这个列表为例:http://www.tupianzj.com/m

前言,以下采集只供学习使用我和这个站长也没仇,只是随便找的一个站做为测试使用。下面开始,我们以这个列表为例:http://www.tupianzj.com/mingxing/xiezhen/nv/list_7091_1.html

我们想要采集女明星类别下的所有图片,通过分析可以看出来在这个大列表下面还有一个小列表,在小列表下面才是正文。

62b6947185b79a1edb0fd763939031ea.png

打开第一个“杨颖”看一下小列表

67116b3758427d6329338b7cbc0777c8.png

接着打开小列表中的第一个进入正文

16c83964bb0213ab8c5cd81b0794dc1c.png

以上就是这我们采集的行程,下面通过火车车演示一遍:

第一步:在火车头建立一个任务命名为“明星”,在编辑任务窗口“起始网址”右边点击“添加”-“批量/多页”,地址格式输入:“http://www.tupianzj.com/mingxing/xiezhen/nv/list_7091_(*).html”,等差数列首项为1,项数为11(规定大列表网址)如下图:

0d9f0b46e651e8ddd9427a4825357d91.png

第二步:还是这个窗口在“多级网址获取”窗口右边点击添加,在“网址获取选项”中选择“手动填写链接地址规则”,在右边“脚本规则”中填写如下代码:

(*)

li在实际连接中填写“[参数1]”。(选择要采集的大列表范围)如下图:

fbf71d5974615223069172afd09747f8.png

第三步:同第二步点击“添加”在“网址获取选项”中还是选择“手动填写链接地址规则”在脚本规则中填写如下代码:

%5B%E6%A0%87%E7%AD%BE:%E7%BC%A9%E7%95%A5%E5%9B%BE%5D 然后还在实际连接中填写“[参数1]”。(选择要采集的小列表范围并获取列表缩略图)如下图: