基於Python爬取愛奇藝資源過程解析
阿新 • • 發佈:2020-03-03
像iqiyi這種視訊網站,現在下載視訊都需要下載相應的客戶端。那麼如何不用下載客戶端,直接下載非vip視訊?
選擇你想要爬取的內容
該安裝的程式以及執行環境都配置好
下面這段程式碼就是我在愛奇藝裡搜素“英文名”,然後出來的視訊,共有20頁,那麼我們便從第一頁開始,解析網頁,然後分析
分析每一頁網址,找出規律就可以直接得到所有頁面
然後根據每一個視訊的URL的標籤,如'class' 'div' 'href'......通過bs4庫進行爬取
而其他的資訊則是直接迴圈所爬取到的URL,在每一個裡再通過標籤去找
import requests import pandas as pd from bs4 import BeautifulSoup #爬取URL headers={'user-agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML,like Gecko) Chrome/79.0.3945.79 Safari/537.36'} b=[] for i in range(1,2): url="https://so.iqiyi.com/so/q_英文名_ctg_t_0_page_"+str(i)+"_p_1_qc_0_rd__site__m_1_bitrate_" #共20頁,根據每頁的網址變換規律進行拼接 r=requests.get(url,headers=headers) soup=BeautifulSoup(r.text,"html.parser") a=soup.findAll('a',{'class':'main-tit'}) for i in a: if 'http://www.'in i.get('href')and 'html'in i.get('href'): b.append(i.get('href')) print(b) #爬取標題 e=[] for k in b: res=requests.get(k,headers=headers) Soup=BeautifulSoup(res.text,'html.parser') c=Soup.findAll('div',{'class':'feed-title-box'}) for d in c: e.append(d.find('h1').text) print(e) #爬取標題下方描述 f=[] for j in b: res=requests.get(j,{'class':'qy-play-intro-feed'}) for d in c: f.append(d.find('p',{'class':"intro-iterm__block"}).text) print(f) #爬取釋出時間 h=[] for j in b: res=requests.get(j,{'class':'intro-iterm'}) for d in c: ff=(d.find('span',{'class':"intro-iterm__txt"})) if ff==None: continue h.append(ff.text) print(h) # 爬取上傳作者 m=[] for k in b: res=requests.get(k,'html.parser') c=Soup.find('div',{'id':'block-P'}) d=Soup.find('div',{'class':'qy-player-maker'}) try: name=c.get(':uploader').split(',')[1].split(':')[1].replace('"','')#輸出是字串的格式,所以用split切割。replace替換 except: try: name=d.get(':uploader').split(','') except: m.append("匿名使用者") m.append(name) print(m)
上面的程式碼輸出結果便是英文名的所有網址及其視訊中的一些資訊
這裡我需要講一下的是,為什麼在爬取作者資訊的模組裡我採取了try的方法,因為在我爬取的過程中我發現,有的視訊的上傳作者在視訊左下方,有的在視訊的右下方,有的視訊乾脆沒有上傳作者。
同樣的,你想要爬取其他內容也可以用這種方法獲取URL和他的其他資訊
以上就是本文的全部內容,希望對大家的學習有所幫助,也希望大家多多支援我們。