1. 程式人生 > >python中urllib, urllib2,urllib3, httplib,httplib2, request的區別

python中urllib, urllib2,urllib3, httplib,httplib2, request的區別

若只使用python3.X, 下面可以不看了, 記住有個urllib的庫就行了

python2.X 有這些庫名可用: urllib, urllib2, urllib3, httplib, httplib2, requests

python3.X 有這些庫名可用: urllib, urllib3, httplib2, requests

兩者都有的urllib3和requests, 它們不是標準庫. urllib3 提供執行緒安全連線池和檔案post支援,與urllib及urllib2的關係不大. requests 自稱HTTP for Humans, 使用更簡潔方便

對於python2.X:
urllib和urllib2的主要區別:

urllib2可以接受Request物件為URL設定頭資訊,修改使用者代理,設定cookie等, urllib只能接受一個普通的URL.
urllib提供一些比較原始基礎的方法而urllib2沒有這些, 比如 urlencode
urllib官方文件的幾個例子

使用帶引數的GET方法取回URL

import urllib
params = urllib.urlencode({'spam': 1, 'eggs': 2, 'bacon': 0})
f = urllib.urlopen("http://www.musi-cal.com/cgi-bin/query?%s" % params)
print f.read
()

使用POST方法

import urllib
params = urllib.urlencode({'spam': 1, 'eggs': 2, 'bacon': 0})
f = urllib.urlopen("http://www.musi-cal.com/cgi-bin/query", params)
print f.read()

使用HTTP代理,自動跟蹤重定向

import urllib
proxies = {'http': 'http://proxy.example.com:8080/'}
opener = urllib.FancyURLopener(proxies)
f = opener.open
("http://www.python.org") f.read()

不使用代理

import urllib
opener = urllib.FancyURLopener({})
f = opener.open("http://www.python.org/")
f.read()

urllib2的幾個官方文件的例子:

GET一個URL

>>> import urllib2
>>> f = urllib2.urlopen('http://www.python.org/')
>>> print f.read()

使用基本的HTTP認證

import urllib2
auth_handler = urllib2.HTTPBasicAuthHandler()
auth_handler.add_password(realm='PDQ Application',
                          uri='https://mahler:8092/site-updates.py',
                          user='klem',
                          passwd='kadidd!ehopper')
opener = urllib2.build_opener(auth_handler)
urllib2.install_opener(opener)
urllib2.urlopen('http://www.example.com/login.html')

build_opener() 預設提供很多處理程式, 包括代理處理程式, 代理預設會被設定為環境變數所提供的.

一個使用代理的例子

proxy_handler = urllib2.ProxyHandler({'http': 'http://www.example.com:3128/'})
proxy_auth_handler = urllib2.ProxyBasicAuthHandler()
proxy_auth_handler.add_password('realm', 'host', 'username', 'password')

opener = urllib2.build_opener(proxy_handler, proxy_auth_handler)
opener.open('http://www.example.com/login.html')

新增HTTP請求頭部

import urllib2
req = urllib2.Request('http://www.example.com/')
req.add_header('Referer', 'http://www.python.org/')
r = urllib2.urlopen(req)

更改User-agent

import urllib2
opener = urllib2.build_opener()
opener.addheaders = [('User-agent', 'Mozilla/5.0')]
opener.open('http://www.example.com/')

httplib 和 httplib2 httplib 是http客戶端協議的實現,通常不直接使用, urllib是以httplib為基礎 httplib2 是第三方庫, 比httplib有更多特性

httplib比較底層,一般使用的話用urllib和urllib2即可

對於python3.X:
這裡urllib成了一個包, 此包分成了幾個模組,

urllib.request 用於開啟和讀取URL, 
urllib.error 用於處理前面request引起的異常, 
urllib.parse 用於解析URL, 
urllib.robotparser用於解析robots.txt檔案
python2.X 中的 urllib.urlopen()被廢棄, urllib2.urlopen()相當於python3.X中的urllib.request.urlopen()

幾個官方例子:

GET一個URL

import urllib.request
with urllib.request.urlopen('http://www.python.org/') as f:
...     print(f.read(300))

PUT一個請求

import urllib.request
DATA=b'some data'
req = urllib.request.Request(url='http://localhost:8080', data=DATA,method='PUT')
with urllib.request.urlopen(req) as f:
    pass
print(f.status)
print(f.reason)

基本的HTTP認證

import urllib.request
auth_handler = urllib.request.HTTPBasicAuthHandler()
auth_handler.add_password(realm='PDQ Application',
                          uri='https://mahler:8092/site-updates.py',
                          user='klem',
                          passwd='kadidd!ehopper')
opener = urllib.request.build_opener(auth_handler)
urllib.request.install_opener(opener)
urllib.request.urlopen('http://www.example.com/login.html')

使用proxy

proxy_handler = urllib.request.ProxyHandler({'http': 'http://www.example.com:3128/'})
proxy_auth_handler = urllib.request.ProxyBasicAuthHandler()
proxy_auth_handler.add_password('realm', 'host', 'username', 'password')

opener = urllib.request.build_opener(proxy_handler, proxy_auth_handler)
opener.open('http://www.example.com/login.html')

新增頭部

import urllib.request
req = urllib.request.Request('http://www.example.com/')
req.add_header('Referer', 'http://www.python.org/')
r = urllib.request.urlopen(req)

更改User-agent

import urllib.request
opener = urllib.request.build_opener()
opener.addheaders = [('User-agent', 'Mozilla/5.0')]
opener.open('http://www.example.com/')

使用GET時設定URL的引數

>>> import urllib.request
>>> import urllib.parse
>>> params = urllib.parse.urlencode({'spam': 1, 'eggs': 2, 'bacon': 0})
>>> url = "http://www.musi-cal.com/cgi-bin/query?%s" % params
>>> with urllib.request.urlopen(url) as f:
...     print(f.read().decode('utf-8'))
...

使用POST時設定引數

>>> import urllib.request
>>> import urllib.parse
>>> data = urllib.parse.urlencode({'spam': 1, 'eggs': 2, 'bacon': 0})
>>> data = data.encode('ascii')
>>> with urllib.request.urlopen("http://requestb.in/xrbl82xr", data) as f:
...     print(f.read().decode('utf-8'))
...

指定proxy

>>> import urllib.request
>>> proxies = {'http': 'http://proxy.example.com:8080/'}
>>> opener = urllib.request.FancyURLopener(proxies)
>>> with opener.open("http://www.python.org") as f:
...     f.read().decode('utf-8')
...

不使用proxy, 覆蓋環境變數的proxy

>>> import urllib.request
>>> opener = urllib.request.FancyURLopener({})
>>> with opener.open("http://www.python.org/") as f:
...     f.read().decode('utf-8')
...

python2.X中的httplib被重新命名為 http.client

使用 2to3 工具轉換原始碼時, 會自動處理這幾個庫的匯入

總的來說, 使用python3, 記住只有urllib, 想要更簡潔好用就用requests, 但不夠通用