python爬蟲知識點三--解析豆瓣top250數據

阿新 • • 發佈：2017-11-19

www request 10.8 blog 分享 encode uid gb2 on()

一。利用cookie訪問
import requests

headers = {‘User-Agent‘: ‘Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/44.0.2403.157 Safari/537.36‘}
cookies = {‘cookie‘: ‘bid=a3MhK2YEpZw; ll="108296"; ps=y; ue="[email protected]"; _pk_ref.100001.8cb4=%5B%22%22%2C%22%22%2C1482650884%2C%22https%3A%2F%2Fwww.so.com%2Fs%3Fie%3Dutf-8%26shb%3D1%26src%3Dhome_so.com%26q%3Dpython%2B%25E8%25B1%2586%25E7%2593%25A3%25E6%25BA%2590%22%5D; _gat_UA-7019765-1=1; ap=1; __utmt=1; _ga=GA1.2.1329310863.1477654711; dbcl2="2625855:/V89oXS4WD4"; ck=EePo; push_noty_num=0; push_doumail_num=0; _pk_id.100001.8cb4=40c3cee75022c8e1.1477654710.8.1482652441.1482639716.; _pk_ses.100001.8cb4=*; __utma=30149280.1329310863.1477654711.1482643456.1482650885.10; __utmb=30149280.19.10.1482650885; __utmc=30149280; __utmz=30149280.1482511651.7.6.utmcsr=blog.csdn.net|utmccn=(referral)|utmcmd=referral|utmcct=/alanzjl/article/details/50681289; __utmv=30149280.262; _vwo_uuid_v2=64E0E442544CB2FE2D322C59F01F1115|026be912d24071903cb0ed891ae9af65 
‘}
url = ‘http://www.douban.com‘
r = requests.get(url, cookies = cookies, headers = headers)
with open(‘douban_2.txt‘, ‘wb+‘) as f:
    f.write(r.content)

二。利用Xpath搜索

import requests
from lxml import etree

s = requests.Session()
for id in range(0, 251, 25):
    print (id)

    url = ‘https://movie.douban.com/top250/?start- 
‘ + str(id)
    r = s.get(url)
    r.encoding = ‘utf-8‘
    root = etree.HTML(r.content)
    items = root.xpath(‘//ol/li/div[@class="item"]‘) //利用xpath的標簽選擇




    # print(len(items))
    for item in items:
        title = item.xpath(‘./div[@class="info"]//a/span[@class="title"]/text()‘)//如下找到中文名字


        name  
= title[0].encode(‘gb2312‘, ‘ignore‘).decode(‘gb2312‘)//title是一個數組  先encoding 再decode確保字符不混在一起
        # rank = item.xpath(‘./div[@class="pic"]/em/text()‘)[0]
        rating = item.xpath(‘.//div[@class="bd"]//span[@class="rating_num"]/text()‘)[0]

print(name, rating)

結果：成功爬取前250個評分技術分享圖片

ps:必須知道網頁的結構

python爬蟲知識點三--解析豆瓣top250數據

www request 10.8 blog 分享 encode uid gb2 on() 一。利用cookie訪問import requests headers = {‘User-Agent‘: ‘Mozilla/5.0 (Windows NT 6.3; WOW64)

我的第一個python爬蟲：爬取豆瓣top250前100部電影

爬取豆瓣top250前100部電影 1 # -*-coding=UTF-8 -*- 2 3 import requests 4 from bs4 import BeautifulSoup 5 6 headers = {'User-Agent':'Moz

python爬蟲循環導入MySql數據庫

ron 9.png 需要 ets 版本對象 root 內容 clas 1、開發環境操作系統：win10 Python 版本：Python 3.5.2 MySQL：5.5.53 2、用到的模塊沒有的話使用pip進行安裝：pip install

python爬蟲25 | 爬取下來的數據怎麽保存？ CSV 了解一下

omd iyu dpm jpeg mkt dsa tmm bgm aso 大家好我是小帥b 是一個練習時長兩年半的練習生喜歡唱！跳！ rap！籃球！敲代碼！裝逼！

python scrapy框架爬取豆瓣top250電影篇一明確目標&&爬蟲編寫

1.明確目標 1.1在url上找到要爬取的資訊 1.2.確定了資訊,編寫items檔案 class DoubanItem(scrapy.Item): &nb

Python爬蟲練習三：爬取豆瓣電影分類排行榜

目標網址url: https://movie.douban.com/typerank?type_name=%E5%8A%A8%E4%BD%9C&type=5&interval_id=100:90&action= 使用谷歌瀏覽器的檢查

[python爬蟲入門]爬取豆瓣電影排行榜top250

要爬取內容的是豆瓣網的電影排行top250: https://movie.douban.com/top250, 將電影名和評分爬取下來並輸出, 如下圖: 使用了tkinter做了簡單頁面然後分析如何爬取內容: 首先爬取標題: 檢視原始碼後, 發現標

Python爬蟲小案例：豆瓣電影TOP250

原始碼： #!/usr/bin/python3 # -*-coding: UTF-8-*- from urllib import request import re class MovieTop250(object): def __init

python 爬蟲學習三（Scrapy 實戰，豆瓣爬取電影資訊）

利用Scrapy爬取豆瓣電影資訊主要列出Scrapy的三部分程式碼： spider.py檔案： # _*_ coding=utf-8 _*_ import scrapy from course.douban_items import DouBanItem from scra

Python基礎第三篇：函數

turn 說明代碼名稱維護 span 大小寫 div 邏輯一、Python函數介紹 1.函數的作用規範代碼使代碼變得邏輯性更強提高可讀性，方便管理，降低維護成本，以及降低代碼冗余函數是組織好的，可重復使用的，用來實現單一，或相關聯功能的代碼段。 2.函

python學習【第三篇】基本數據類型

ini ati 絕對值 ef6 ict trunc any 替換不包含 Number(數字) int（整型）　　在32位機器上，整數的位數為32位，取值範圍為-2**31～2**31-1，即-2147483648～2147483647　　在64位系統上，整數的位數為6

2017.08.04 Python網絡爬蟲之Scrapy爬蟲實戰二天氣預報的數據存儲問題

sql語句 city amd64 ces img href asp encoding primary 1.數據存儲到JSon：程序閱讀一般都是使用更方便的Json或者cvs等待格式，繼續講解Scrapy爬蟲的保存方式，也就是繼續對pipelines.py文件動手腳（1）創

Python爬蟲入門三之Urllib庫的基本使用

res 瀏覽器中必須答案文件的網頁 one .com 屏幕截圖 1.分分鐘扒一個網頁下來怎樣扒網頁呢？其實就是根據URL來獲取它的網頁信息，雖然我們在瀏覽器中看到的是一幅幅優美的畫面，但是其實是由瀏覽器解釋才呈現出來的，實質它是一段HTML代碼，加 JS、CSS

團隊-張文然-需求分析-python爬蟲分類爬取豆瓣電影信息

工具新的翻頁需求使用 html 頁面應該一個首先要明白爬網頁實際上就是：找到包含我們需要的信息的網址（URL）列表通過 HTTP 協議把頁面下載回來從頁面的 HTML 中解析出需要的信息找到更多這個的 URL，回到 2 繼續其次還要明白：一個好的列表應該：包含

Python爬蟲抓取東方財富網股票數據並實現MySQL數據庫存儲

alt 插入 pytho width 重新 tab 空值 utf word Python爬蟲可以說是好玩又好用了。現想利用Python爬取網頁股票數據保存到本地csv數據文件中，同時想把股票數據保存到MySQL數據庫中。需求有了，剩下的就是實現了。在開始之前，保證已經

Python爬蟲利器三之Xpath語法與lxml庫的用法

blank color idt tab 一段並且 .text rst 基本用法前面我們介紹了 BeautifulSoup 的用法，這個已經是非常強大的庫了，不過還有一些比較流行的解析庫，例如 lxml，使用的是 Xpath 語法，同樣是效率比較高的解析方法。如果大家

運維學python之爬蟲中級篇（五）數據存儲（無數據庫版）

就是 erro mage name 打印反序 lis object Circul 本篇主要介紹，爬取html數據後，將html的正文內容存儲為json或csv格式。 1 json格式存儲選定要爬取的網站後，我們利用之前學過的內容，如：Beautiful Soup、xpa

Python爬蟲入門 | 爬取豆瓣電影信息

Python 編程語言 web開發這是一個適用於小白的Python爬蟲免費教學課程，只有7節，讓零基礎的你初步了解爬蟲，跟著課程內容能自己爬取資源。看著文章，打開電腦動手實踐，平均45分鐘就能學完一節，如果你願意，今天內你就可以邁入爬蟲的大門啦~好啦，正式開始我們的第二節課《爬取豆瓣電影信息》吧！啦啦哩啦啦，

python 培訓第三章，函數，裝飾器，模塊，內置函數之一函數

python目錄：函數示例裝飾器模塊內置函數一、函數示例：　1、定義函數：　　　　def fun(args):　　　　　　‘描述信息‘　　　　　　函數體　　　　return 返回值　　定義函數的三種形式：　　　　無參函數def foo():print(‘in the foo‘)

[Doctrine Migrations] 數據庫遷移組件的深入解析三：自定義數據字段類型

con 組件 extends arr TP value ctr ets field 自定義type 根據官方文檔，新建TinyIntType類，集成Type，並重寫getName，getSqlDeclaration，convertToPHPValue，getBindingT

python爬蟲知識點三--解析豆瓣top250數據

相關推薦