使用python抓取App資料

阿新 • • 發佈：2018-12-30

App中的資料可以用網路爬蟲抓取麼

答案是完全肯定的：凡是可以看到的APP資料都可以抓取。
下面我就介紹下自己的學習經驗和一些方法吧本篇適合有過web爬蟲基礎的程式猿看
沒有的的話學的可能會吃力一些

App介面爬取資料過程

使用抓包工具
手機使用代理，app所有請求通過抓包工具
獲得介面，分析介面
反編譯apk獲取key
突破反爬限制

需要的工具：

夜神模擬器
Pycharm

實現過程

首先下載夜神模擬器模擬手機也可以用真機，然後下載Fiddler抓取手機APP資料包，分析介面完成以後使用Python實現爬蟲程式

Fiddler安裝配置過程

第一步：下載神器Fiddler

Fiddler下載完成之後，傻瓜式的安裝一下！

第二步：設定Fiddler

開啟Fiddler, Tools-> Fiddler Options (配置完後記得要重啟Fiddler)
選中”Decrpt HTTPS traffic”, Fiddler就可以截獲HTTPS請求
選中”Allow remote computers to connect”. 是允許別的機器把HTTP/HTTPS請求傳送到Fiddler上來
這裡寫圖片描述

記住這個埠號是:8888

夜神模擬器安裝配置過程

第一步:下載安裝

夜神模擬器下載完成之後，傻瓜式的安裝一下！

第二步:配置橋接實現互通

首先將當前手機網路橋接到本電腦網路實現互通
這裡寫圖片描述
安裝完成橋接驅動後配置IP地址，要配成和本機互通的網段，配置完成後開啟主機cmd終端ping通ok

第三步:配置代理

開啟主機cmd
輸入ipconfig檢視本機IP
配置代理
進入夜神模擬器–開啟設定–開啟WLAN

點選修改網路–配置代理如下圖：

配置完後儲存
到這裡我們就設定好所有的值，下面就來測試一下，開啟手機的超級課程表APP
在夜神模擬器上下載你想爬取得App使用Fiddler抓包分析api後使用python進行爬取就可以了

爬取充電網APP例項

爬取部分內容截圖：
這裡寫圖片描述
部分python程式碼分享：

import requests
import city
import json
import jsonpath
import re

city_list = city.jsons
tags_list = city.Tag

def city_func(city_id):
    try:
        city = jsonpath.jsonpath(city_list, '$..sub[?(@.code=={})]'.format(int(city_id)))[0]["name"]
    except:
        city = jsonpath.jsonpath(city_list, '$[?(@.code=={})]'.format(int(city_id)))[0]["name"]
    return city

def tags_func(tags_id):
    tags_join = []
    if tags_id:
        for tags in tags_id:
            t = jsonpath.jsonpath(tags_list,'$..spotFilterTags[?(@.id=={})]'.format(int(tags)))
            tags_join.append(t[0]["title"])

    return ('-'.join(tags_join))

def split_n(ags):
    return re.sub('\n','  ',ags)


def request(page):
    print('開始下載第%d頁'%page)
    url = 'https://app-api.chargerlink.com/spot/searchSpot'
    two_url = "https://app-api.chargerlink.com/spot/getSpotDetail?spotId={d}"
    head = {
        "device": "client=android&cityName=%E5%8C%97%E4%BA%AC%E5%B8%82&cityCode=110106&lng=116.32154281224254&device_id=8A261C9D60ACEBDED7CD3706C92DD68E&ver=3.7.7&lat=39.895024107858724&network=WIFI&os_version=19",
        "appId": "20171010",
        "timestamp": "1532342711477",
        "signature": "36daaa33e7b0d5d29ac9c64a2ce6c4cf",
        "forcecheck": "1",
        "Content-Type": "application/x-www-form-urlencoded",
        "Content-Length": "68",
        "Host": "app-api.chargerlink.com",
        "Connection": "Keep-Alive",
        "User-Agent": "okhttp/3.2.0"
    }


    data = {
        "userFilter[operateType]": 2,
        "cityCode": 110000,
        "sort": 1,
        "page": page,
        "limit": 10,
    }

    response = requests.post(url,data=data,headers=head)
    #獲取資料
    data = response.json()
    for i in data['data']:
        c = []
        id = i['id']
        name = i["name"] #充電樁名
        phone = i["phone"] #手機號
        num = i['quantity'] #有幾個充電樁
        city = city_func(i["provinceCode"]) #城市
        tags =tags_func(i["tags"].split(','))#標籤
        message = c + [id,name,phone,num,city,tags]
        parse_info(two_url.format(d=id),message)

def parse_info(url,message):

    #開啟檔案
    with open('car.csv','a',encoding='utf-8')as c:
        head = {
            "device": "client=android&cityName=&cityCode=&lng=116.32154281224254&device_id=8A261C9D60ACEBDED7CD3706C92DD68E&ver=3.7.7&lat=39.895024107858724&network=WIFI&os_version=19",
            "TOKEN": "036c8e24266c9089db50899287a99e65dc3bf95f",
            "appId": "20171010",
            "timestamp": "1532357165598",
            "signature": "734ecec249f86193d6e54449ec5e8ff6",
            "forcecheck": "1",
            "Host": "app-api.chargerlink.com",
            "Connection": "Keep-Alive",
            "User-Agent": "okhttp/3.2.0",
        }
        #發起詳情請求
        res = requests.get(url,headers=head)
        price = split_n(jsonpath.jsonpath(json.loads(res.text),'$..chargingFeeDesc')[0]) #價錢
        payType = jsonpath.jsonpath(json.loads(res.text),'$..payTypeDesc')[0] #支付方式
        businessTime =split_n(jsonpath.jsonpath(json.loads(res.text),'$..businessTime')[0]) #營業時間
        result = (message + [price,payType,businessTime])
        r = ','.join([str(i) for i in result])+',\n'
        c.write(r)

def get_page():
    url = 'https://app-api.chargerlink.com/spot/searchSpot'
    head = {
        "device": "client=android&cityName=%E5%8C%97%E4%BA%AC%E5%B8%82&cityCode=110106&lng=116.32154281224254&device_id=8A261C9D60ACEBDED7CD3706C92DD68E&ver=3.7.7&lat=39.895024107858724&network=WIFI&os_version=19",
        "appId": "20171010",
        "timestamp": "1532342711477",
        "signature": "36daaa33e7b0d5d29ac9c64a2ce6c4cf",
        "forcecheck": "1",
        "Content-Type": "application/x-www-form-urlencoded",
        "Content-Length": "68",
        "Host": "app-api.chargerlink.com",
        "Connection": "Keep-Alive",
        "User-Agent": "okhttp/3.2.0"
    }

    data = {
        "userFilter[operateType]": 2,
        "cityCode": 110000,
        "sort": 1,
        "page": 1,
        "limit": 10,
    }
    response = requests.post(url, data=data, headers=head)
    # 獲取資料
    data = response.json()
    total = (data["pager"]["total"])
    page_Size = (data["pager"]["pageSize"])
    totalPage = (data['pager']["totalPage"])
    print('當前共有{total}個充電樁，每頁展示{page_Size}個，共{totalPage}頁'.format(total=total,page_Size=page_Size,totalPage=totalPage))
if __name__ == '__main__':
    get_page()
    start = int(input("親,請輸入您要獲取的開始頁:"))
    end = int(input("親,請輸入您要獲取的結束頁:"))
    for  i in range(start,end+1):
        request(i)

總結：

app裡的資料比web端更容易抓取，反爬蟲也沒拿麼強，大部分也都是http/https協議，返回的資料型別大多數為json

使用python抓取App資料

App中的資料可以用網路爬蟲抓取麼答案是完全肯定的：凡是可以看到的APP資料都可以抓取。下面我就介紹下自己的學習經驗和一些方法吧本篇適合有過web爬蟲基礎的程式猿看沒有的的話學的可能會吃力一些 App介面爬取資料過程使用抓包工具手機使

夜神模擬器配置burpsuite抓取APP資料報文

設定夜神模擬器的代理進入wifi連線選項之後長按熱點，出現修改網路的彈窗點選修改網路，勾選高階選項,將代理設為手動，代理伺服器主機名填寫電腦的ip，埠號填寫8888 點選儲存設定Burpsuite代理在夜神模擬器當中使用瀏覽器瀏覽該代理地

使用fiddler抓取app資料

本文簡單展示如何用Python抓取APP資料，以超級課程表樹洞為例：首先：需要下載抓包神器：fiddler 直接百度下載，然後打來fiddler設定幾個選項：選中"Decrpt HTTPS traffic", Fiddler就可以截獲HTTPS請

python抓取網頁資料處理後視覺化

抓取文章的連結，訪問量儲存到本地 1 #coding=utf-8 2 import requests as req 3 import re 4 import urllib 5 from bs4 import BeautifulSoup 6 import sys 7 import code

Python抓取股票資料，如何用python程式設計賺取第一桶金？

Python開發的一個快速,高層次的螢幕抓取和web抓取框架，用於抓取web站點並從頁面中提取結構化的資料。Scrapy用途廣泛，可以用於資料探勘、監測和自動化測試。 Scrapy吸引人的地方在於它是一個框架，任何人都可以根據需求方便的修改。它也提供了多種型別爬蟲的基類，如BaseSpid

利用Fiddler抓取APP資料

軟體：Fiddler 系統：Windows10 手機：MX4 PRO Fiddler安裝和設定通過地址下載Fiddler安裝包（點選即可跳轉），安裝完成後需要進行簡單的設定。開啟Fiddler進入選單欄Tools > Telerik Fiddler Options > HTTP

python抓取動態資料 A股上市公司基本資訊

1.背景之前寫的抓取A股所有上市公司資訊的小程式在上交所網站改版後，需要同步修改 pyton2.7.9 2.分析過程以抓取宇通客車【600066】資訊為例紅框中的內容是需要抓取的資訊，檢視網頁原始碼可以看到公司資訊並沒有直接寫到html中，使用chrome “

Python抓取網頁資料的終極辦法

假設你在網上搜索某個專案所需的原始資料，但壞訊息是資料存在於網頁中，並且沒有可用於獲取原始資料的API。所以現在你必須浪費30分鐘寫指令碼來獲取資料（最後花費 2小時）。這不難但是很浪費時間。 Pandas庫有一種內建的方法，可以從名為re

使用 Charles 抓取 app 資料包

前言Charles 是一款非常實用的抓包工具。它通過電腦端代理，攔截網路請求和響應來實現資料包的

Python抓取手機APP中內容

quest 手機app 開始 clas tex json 完成 keep 抓取首先下載Wireshark和模擬器（天天模擬器，夜神模擬器），天天模擬器在自帶的應用商店裏面能夠登錄微信。然後打開Wireshark選擇一個網卡開始抓包。開始抓包後，在模擬器中要抓取的APP

利用fiddler抓取APP中的資料

前言做Android開發的朋友經常需要做網路資料的獲取和提交表單資料等操作，然而對於除錯程式而言，很難知道我們的資料到底是以怎樣的形式傳送的，是否傳送成功，如果傳送失敗有是什麼原因引起的。fiddler工具為我們提供了很方便的抓包操作，可以輕鬆抓取瀏覽器的發出的資料，不管是手機APP，還是we

微信好友大揭祕，使用Python抓取朋友圈資料，通過人臉識別全面分析好友，一起看透你的“朋友圈”

微信：一個提供即時通訊服務的應用程式，更是一種生活方式，超過數十億的使用者，越來越多的人選擇使用它來溝通交流。不知從何時起，我們的生活離不開微信，每天睜開眼的第一件事就是開啟微信，關注著朋友圈裡好友的動態，而朋友圈中或虛或實的狀態更新，似乎都在證明自己的“有趣

用Python抓取朋友圈資料，通過人臉識別全面分析好友！看透朋友圈

微信：一個提供即時通訊服務的應用程式，更是一種生活方式，超過數十億的使用者，越來越多的人選擇使用它來溝通交流。不知從何時起，我們的生活離不開微信，每天睜開眼的第一件事就是開啟微信，關注著朋友圈裡好友的動態，而朋友圈中或虛或實的狀態更新，似乎都在證明自己的“有趣”，尋找那份

python抓取國家統計局省市區街道社群資料

一、說明在網上百度下載省市區等資料，不是要積分下載就是要錢，我等窮逼既無積分又無錢，那就只有另想辦法，學過幾天python，用python將就抓點資料，借鑑別人一些寫法，再修修補補，除錯bug，基本上可以執行，並將抓取的資料儲存至MySQL資料庫中（抓取之前換成自己的資料

Python爬蟲抓取大資料崗位招聘資訊（51job為例）

簡單介紹一下爬蟲原理。並給出 51job網站完整的爬蟲方案。爬蟲基礎知識資料來源網路爬蟲的資料一般都來自伺服器的響應結果，通常有html和json資料等，這兩種資料也是網路爬蟲的主要資料來源。其中html資料是網頁的原始碼，通過瀏覽器-檢視原始碼可

Python爬蟲入門教程 16-100 500px攝影師社群抓取攝影師資料

寫在前面今天要抓取的網站為 https://500px.me/ ，這是一個攝影社群，在一個攝影社群裡面本來應該爬取的是圖片資訊，可是我發現好像也沒啥有意思的，忽然覺得爬取一下這個網站的攝影師更好玩一些，所以就有了這篇文章的由來。基於上面的目的，我找了了一個不錯的頁面 https://50

學習python抓取資料——鏈家北京二手房資料

最近在學習用Python進行資料分析、機器學習，基本都是用現成資料集進行模型訓練及驗證，想用一些實際資料看一下效果，於是想到用Python嘗試抓取一些實際資料。目標：爬取鏈家網北京二手房房價、位置、面積等資料環境：Python3.5.2，Anaconda4.2.0 1.準備工作

七種方法實現Python抓取資料的視覺化

Python 的scientific stack（一個介紹Python科學計算包的網站）已經完全成熟，並且有各種各樣用例的庫，包括機器學習（連結：machine learning），資料分析（連結：data analysis）。資料視覺化是探索資料和清晰的解釋結果很重要的一部分，

Python爬蟲：十分鐘實現從資料抓取到資料API提供

依舊先從爬蟲的基本概念說起，你去做爬蟲做資料抓取，第一件事想必是去檢視目標網站是否有api。有且可以使用的話，皆大歡喜。假如目標網站自身不提供api，但今天你心情不好就想用api來抓資料，那

python 爬蟲（四）抓取Ajax資料

import urllib.request import ssl import json def ajaxCrawler(url): headers = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKi

使用python抓取App資料

App中的資料可以用網路爬蟲抓取麼

App介面爬取資料過程

需要的工具：

實現過程

Fiddler安裝配置過程

第一步：下載神器Fiddler

第二步：設定Fiddler

夜神模擬器安裝配置過程

第一步:下載安裝

第二步:配置橋接 實現互通

第三步:配置代理

爬取充電網APP例項

總結：

相關推薦

第二步:配置橋接實現互通