python爬蟲實現爬取同一個網站的多頁資料的例項講解
阿新 • • 發佈:2021-01-20
對於一個網站的圖片、文字音視訊等,如果我們一個個的下載,不僅浪費時間,而且很容易出錯。Python爬蟲幫助我們獲取需要的資料,這個資料是可以快速批量的獲取。本文小編帶領大家通過python爬蟲獲取獲取總頁數並更改url的方法,實現爬取同一個網站的多頁資料。
一、爬蟲的目的
從網上獲取對你有需要的資料
二、爬蟲過程
1、獲取url(網址)。
2、發出請求,獲得響應。
3、提取資料。
4、儲存資料。
三、爬蟲功能
可以快速批量的獲取想要的資料,不用手動的一個個下載(圖片、文字音視訊等)
四、使用python爬蟲爬取同一網站多頁資料
1、需要定位至該標籤並獲得總頁數
def get_page_size(soup): pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav') pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a') for i in pcxt1[:-1]: link=i.get('href') s=str(i) page=re.sub('<a href="','',s) page1=re.sub(link,page) page2=re.sub('">',page1) page3=re.sub('</a>',page2) pagesize=int(page3) print(pagesize) return pagesize Pass
2、更改url來訪問網址,也就是進行主函式的編寫
if __name__ == '__main__': url="http://www.sheknows.com/baby-names/browse/a/" soup=get_requests(url) page=get_page_size(soup) for i in range(1,page+1): url1=url+"page/"+str(i)+"/" soup1=get_requests(url1) draw_base_list(soup1)
例項擴充套件:
import requests from lxml import etree import re url="https://movie.douban.com/top250" header = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML,like Gecko) Chrome/79.0.3945.130 Safari/537.36"} allMovieList=[] flag = True while flag: html = requests.get(url,headers=header).text list = etree.HTML(html) lis = list.xpath('//ol[@class="grid_view"]/li') for oneSelector in lis: name = oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0] score = oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0] people = oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0] people = re.findall("(.*?)人評價",people)[0] oneMovieList = [name,score,people] allMovieList.append(oneMovieList) #獲取下一頁地址 try: next_url = list.xpath('//span[@class="next"]/a/@href')[0] if next_url: url = "https://movie.douban.com/top250"+ next_url except: flag = False print(allMovieList)
到此這篇關於python爬蟲實現爬取同一個網站的多頁資料的例項講解的文章就介紹到這了,更多相關python爬蟲如何實現爬取同一個網站的多頁資料內容請搜尋我們以前的文章或繼續瀏覽下面的相關文章希望大家以後多多支援我們!