1. 程式人生 > 程式設計 >python爬蟲 執行緒池建立並獲取檔案程式碼例項

python爬蟲 執行緒池建立並獲取檔案程式碼例項

本例項主要進行執行緒池建立,多執行緒獲取、儲存視訊檔案

梨視訊:利用執行緒池進行視訊爬取

#爬取梨視訊資料
import requests
import re
from lxml import etree
from multiprocessing.dummy import Pool
import random

# 定義獲取視訊資料方法
def getVideoData(url): # url為列表中的視訊url
  return requests.get(url=url,headers=headers).content

# 定義儲存資料方法
def saveVideo(data):
  fileName = str(random.randint(0,5000))+'.mp4'
  with open(fileName,'wb') as fp:
    fp.write(data)

# 爬取資料
#例項化一個執行緒池物件,開啟5個執行緒池
pool = Pool(5)

url = 'https://www.pearvideo.com/category_1'
headers = {
  'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML,like Gecko) Chrome/72.0.3626.119 Safari/537.36'
}
page_text = requests.get(url=url,headers=headers).text
tree = etree.HTML(page_text)
li_list = tree.xpath('//div[@id="listvideoList"]/ul/li')

video_url_list = [] # 存的是將要下載視訊的url
for li in li_list:
  detail_url = 'https://www.pearvideo.com/'+li.xpath('./div/a/@href')[0]
  detail_page = requests.get(url=detail_url,headers=headers).text
  #因為視訊連線不在標籤匯中,而是一個js語句,所以用正則匹配
  video_url = re.findall('srcUrl="(.*?)",vdoUrl',detail_page,re.S)[0]
  video_url_list.append(video_url)
  
# map函式的應用:引數1:回撥函式,引數2:列表;
#將列表中的引數賦值給回撥函式的形參,讓回撥函式處理
video_data_list = pool.map(getVideoData,video_url_list)

pool.map(saveVideo,video_data_list)

以上就是本文的全部內容,希望對大家的學習有所幫助,也希望大家多多支援我們。