python爬蟲實現爬取同一個網站的多頁資料的例項講解

阿新 • • 發佈：2021-01-20

對於一個網站的圖片、文字音視訊等，如果我們一個個的下載，不僅浪費時間，而且很容易出錯。Python爬蟲幫助我們獲取需要的資料，這個資料是可以快速批量的獲取。本文小編帶領大家通過python爬蟲獲取獲取總頁數並更改url的方法，實現爬取同一個網站的多頁資料。

一、爬蟲的目的

從網上獲取對你有需要的資料

二、爬蟲過程

1、獲取url（網址）。

2、發出請求，獲得響應。

3、提取資料。

4、儲存資料。

三、爬蟲功能

可以快速批量的獲取想要的資料，不用手動的一個個下載(圖片、文字音視訊等)

四、使用python爬蟲爬取同一網站多頁資料

1、需要定位至該標籤並獲得總頁數

def get_page_size(soup):
  pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav')
  pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a')
  for i in pcxt1[:-1]:
    link=i.get('href')
    s=str(i)
  page=re.sub('<a href="','',s)
  page1=re.sub(link,page)
  page2=re.sub('">',page1)
  page3=re.sub('</a>',page2)
  pagesize=int(page3)
  print(pagesize)
  return pagesize
Pass

2、更改url來訪問網址，也就是進行主函式的編寫

if __name__ == '__main__':
    url="http://www.sheknows.com/baby-names/browse/a/"
    soup=get_requests(url)
    page=get_page_size(soup)
    for i in range(1,page+1):
      url1=url+"page/"+str(i)+"/"
      soup1=get_requests(url1)
      draw_base_list(soup1)

例項擴充套件：

import requests
from lxml import etree
import re

url="https://movie.douban.com/top250"
header = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML,like Gecko) Chrome/79.0.3945.130 Safari/537.36"}

allMovieList=[]
flag = True
while flag:
  html = requests.get(url,headers=header).text
  list = etree.HTML(html)
  lis = list.xpath('//ol[@class="grid_view"]/li')
  for oneSelector in lis:
    name = oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0]
    score = oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0]
    people = oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0]
    people = re.findall("(.*?)人評價",people)[0]
    oneMovieList = [name,score,people]
    allMovieList.append(oneMovieList)
  #獲取下一頁地址
  try:
    next_url = list.xpath('//span[@class="next"]/a/@href')[0]
    if next_url:
      url = "https://movie.douban.com/top250"+ next_url
  except:
    flag = False
print(allMovieList)

到此這篇關於python爬蟲實現爬取同一個網站的多頁資料的例項講解的文章就介紹到這了,更多相關python爬蟲如何實現爬取同一個網站的多頁資料內容請搜尋我們以前的文章或繼續瀏覽下面的相關文章希望大家以後多多支援我們！

python爬蟲實現爬取同一個網站的多頁資料的例項講解

一、爬蟲的目的

二、爬蟲過程

三、爬蟲功能

四、使用python爬蟲爬取同一網站多頁資料

python爬蟲實現爬取同一個網站的多頁資料的例項講解

python爬蟲實現爬取網頁主頁資訊（html程式碼）

python爬蟲：爬取某圖外賣資料有這篇文章就夠了

Python 爬蟲批量爬取網頁圖片儲存到本地的實現程式碼

Python爬蟲，爬取網站圖片，詳細解釋（看完就會）

python實現爬取小說網站文字

Python如何實現爬取B站視訊

Python爬蟲之爬取淘女郎照片示例詳解

[python][爬蟲]批量爬取【漫畫DB】的漫畫圖片

python爬蟲實戰---爬取大眾點評評論

python爬蟲實踐爬取今日頭條街拍圖（參考了python3webspider和github上的程式碼）

Python爬蟲：爬取科技新聞，進而整理，產出資料分析

Python爬蟲：爬取喜馬拉雅音訊資料詳解

Python爬蟲：爬取無賬號無限制獲取企查查資訊

python爬蟲：爬取窮遊網的地點資料，世界那麼大，我想去看看。

python爬蟲：爬取某牙直播小姐姐圖片，我的雙手已經按捺不住了

python協程爬取某網站的老賴資料

【Python爬蟲】爬取websockect

Python3爬蟲_爬取Find47網站風景圖片

scrapy爬蟲實現爬取圖片（通過圖片管道）

python爬蟲實現爬取同一個網站的多頁資料的例項講解

一、爬蟲的目的

二、爬蟲過程

三、爬蟲功能

四、使用python爬蟲爬取同一網站多頁資料

相關推薦