Python使用xpath實現圖片爬取

阿新 • • 發佈：2020-09-17

高效能非同步爬蟲

目的：在爬蟲中使用非同步實現高效能的資料爬取操作

非同步爬蟲的方式：

- 多執行緒、多程序（不建議）：

好處：可以為相關阻塞的操作單獨開啟多執行緒或程序，阻塞操作就可以非同步執行;

弊端：無法無限制的開啟多執行緒或多程序。

- 執行緒池、程序池（適當的使用）：

好處：我們可以降低系統對程序或執行緒建立和銷燬的一個頻率，從而很好的降低系統的開銷；

弊端：池中執行緒或程序的資料是有上限的。

程式碼如下

# _*_ coding:utf-8 _*_
"""
@FileName  :6.4k圖片解析爬取（非同步高效能測試）.py
@CreateTime :2020/8/14 0014 10:01
@Author   : Lurker Zhang
@E-mail   : [email protected]
@Desc.   :
"""

import requests
from lxml import etree
from setting.config import *
import json
import os
import time
from multiprocessing.dummy import Pool


def main():
  # 圖片採集源地址
  # source_url = 'http://pic.netbian.com/4kmeinv/'
  # temp_url = 'http://pic.netbian.com/4kmeinv/index_{}.html'
  # source_url = 'http://pic.netbian.com/4kdongman/'
  # temp_url = 'http://pic.netbian.com/4kdongman/index_{}.html'
  source_url = 'http://pic.netbian.com/4kmingxing/'
  temp_url = 'http://pic.netbian.com/4kmingxing/index_{}.html'
  # 本此採集前多少頁,大於1的整數
  page_sum = 136
  all_pic_list_url = []
  if page_sum == 1:
    pic_list_url = source_url
    print('開始下載:' + pic_list_url)
    all_pic_list_url.append(pic_list_url)
  else:
    # 先採集第一頁
    pic_list_url = source_url
    # 呼叫採集單頁圖片連結的函式
    all_pic_list_url.append(pic_list_url)
    # 再採集第二頁開始後面的頁數
    for page_num in range(2,page_sum + 1):
      pic_list_url = temp_url.format(page_num)
      all_pic_list_url.append(pic_list_url)
  # 單頁圖片多執行緒解析
  pool1 = Pool(10)
  pool1.map(down_pic,all_pic_list_url)

  print('採集完成，本地成功下載{0}張圖片,失敗{1}張圖片。'.format(total_success,total_fail))
  # 儲存已下載檔名列表：
  with open("../depository/mingxing/pic_name_list.json",'w',encoding='utf-8') as fp:
    json.dump(pic_name_list,fp)


def down_pic(pic_list_url):
  print("準備解析圖片列表頁：",pic_list_url)
  # 獲取圖片列表頁的網頁資料
  pic_list_page_text = requests.get(url=pic_list_url,headers=headers).text
  tree_1 = etree.HTML(pic_list_page_text)
  # 獲取圖片地址列表
  pic_show_url_list = tree_1.xpath('//div[@class="slist"]/ul//a/@href')
  pic_url_list = [get_pic_url('http://pic.netbian.com' + pic_show_url) for pic_show_url in pic_show_url_list]

  # 開始下載並儲存圖片(多執行緒)
  pool2 = Pool(5)
  pool2.map(save_pic,pic_url_list)


def save_pic(pic_url):
  print("準備下載圖片：",pic_url)
  global total_success,total_fail,pic_name_list,path
  picname = get_pic_name(pic_url)
  if not picname in pic_name_list:
    # 獲取日期作為儲存位置資料夾

    pic = requests.get(url=pic_url,headers=headers).content
    try:
      with open(path + picname,'wb') as fp:
        fp.write(pic)
    except IOError:
      print(picname + "儲存失敗")
      total_fail += 1
    else:
      pic_name_list.append(picname)
      total_success += 1
      print("成功儲存圖片:{0},共成功採集{1}張。".format(picname,total_success))

  else:
    print("跳過，已下載過圖片：" + picname)
    total_fail += 1


def get_pic_name(pic_url):
  return pic_url.split('/')[-1]


def get_pic_url(pic_show_url):
  tree = etree.HTML(requests.get(url=pic_show_url,headers=headers).text)
  return 'http://pic.netbian.com/' + tree.xpath('//div[@class="photo-pic"]/a/img/@src')[0]


if __name__ == '__main__':
  # 讀入已採集圖片的名稱庫，名稱存在重複的表示已經採集過將跳過不採集
  if not os.path.exists('../depository/mingxing/pic_name_list.json'):
    with open("../depository/mingxing/pic_name_list.json",encoding="utf-8") as fp:
      json.dump([],fp)
  with open("../depository/mingxing/pic_name_list.json","r",encoding="utf-8") as fp:
    pic_name_list = json.load(fp)
  path = '../depository/mingxing/' + time.strftime('%Y%m%d',time.localtime()) + '/'
  if not os.path.exists(path):
    os.mkdir(path)
  # 記錄本次採集圖片的數量
  total_success = 0
  total_fail = 0
  main()

以上就是本文的全部內容，希望對大家的學習有所幫助，也希望大家多多支援我們。