python Dataframe pandas 將資料分割成時間跨度相等的資料塊

阿新 • • 發佈：2019-01-24

先上資料，有如下dataframe格式的資料，列名分別為date、ip，我需要統計每5s內出現的ip，以及這些ip出現的頻數。

        ip                  date
0   127.0.0.21  15/Jul/2017:18:22:16
1   127.0.0.13  15/Jul/2017:18:22:16
2   127.0.0.11  15/Jul/2017:18:22:17
3   127.0.0.11  15/Jul/2017:18:22:20
4   127.0.0.21  15/Jul/2017:18:22:21
5   127.0.0.13  15/Jul/2017:18:22:22
6   127.0.0.14 
  15/Jul/2017:18:26:36
7   127.0.0.16  15/Jul/2017:18:32:15
8   127.0.0.11  15/Jul/2017:18:36:03

在網上找了很久但是沒看到python的相關答案，但在stackoverflow找到了R語言的解法，有興趣可以看看。
受它的啟發，我用不太優雅的方式實現了我的需求，有更好解決方法的請不吝賜教：

step1: 將資料中日期格式變為標準格式

#date_ip為我的dataframe資料
date_ip['date'] = pd.to_datetime(date_ip['date'], format='%d/%b/%Y:%H:%M:%S' 
)

step2: 將資料的開始時間、結束時間，按5s分割（由於時間段可能不是恰好是5s的倍數，為避免最後一個時間丟失，因此在最後加上5s）

frequency = 5
time_range = pd.date_range(date_ip['date'][0], date_ip['date'][date_ip.shape[0]-1]+frequency*Second(), freq='%sS'%frequency)

step3: 將date變為索引

date_ip = date_ip.set_index('date')

step4: 對每個時間段內的資料進行頻數計算（由於通過標籤切片時會包含頭、尾資料，為避免重複計算，因此在尾部減1s）

for i in xrange(0,len(time_range)-1):
    print get_frequency(date_ip.loc[time_range[i]:time_range[i+1]-1*Second()])

完整的程式碼

import pandas as pd
from pandas.tseries.offsets import Second
def get_frequency(date_ip):
    ip_frequency = {}
    for i in xrange(0,date_ip.shape[0]):
        ip_frequency[date_ip['ip'][i]] = ip_frequency.get(date_ip['ip'][i], 0) + 1
    return ip_frequency,date_ip.shape[0]

if __name__ == '__main__': 
    date_ip['date'] = pd.to_datetime(date_ip['date'], format='%d/%b/%Y:%H:%M:%S')

    frequency = 5
    time_range = pd.date_range(date_ip['date'][0], date_ip['date'][date_ip.shape[0]-1]+frequency*Second(), freq='%sS'%frequency)  
    date_ip = date_ip.set_index('date')
    for i in xrange(0, len(time_range) - 1):
        print get_frequency(date_ip.loc[time_range[i]:time_range[i + 1]-1*Second()])

文章開頭資料執行結果：

({'127.0.0.21' : 1, '127.0.0.13' : 1, '127.0.0.11' : 2}, 4)
({'127.0.0.21': 1, '127.0.0.13': 1}, 2)
({'127.0.0.14': 1}, 1)
({'127.0.0.16': 1}, 1)
({'127.0.0.11': 1}, 1)

python Dataframe pandas 將資料分割成時間跨度相等的資料塊

先上資料，有如下dataframe格式的資料，列名分別為date、ip，我需要統計每5s內出現的ip，以及這些ip出現的頻數。 ip date 0 127.0.0.21 15/Jul/2017:18:

pandas將DataFrame中的tuple分割成資料框的多列

通過apply(pd.Series)實現將tuple進行分列 df = pd.DataFrame({'a':[1,2], 'b':[(1,2), (3,4)]}) df['b'].apply(pd.Series) df[['b1', 'b2']] = df['b'].apply(pd.S

將伺服器傳來的Long型別的資料轉換成時間

//將long轉換成事件格式 long createTime = resultBean.getCreateTime();//資料 Date date = new Date(createTime);//時間管理類 SimpleDat

Pandas將列表（List）轉換為資料框（Dataframe）

Python中將列表轉換成為資料框有兩種情況：第一種是兩個不同列表轉換成一個數據框，第二種是一個包含不同子列表的列表轉換成為資料框。第一種：兩個不同列表轉換成為資料框 from pandas.

pandas 字串型別轉換成時間型別 object to datetime64[ns]

import pandas as pd from matplotlib import pyplot as plt from datetime import datetime filename='sitka_weather_2014.csv' #AKST df=pd.read_csv(filena

[LeetCode] Split Array into Consecutive Subsequences 將陣列分割成連續子序列

You are given an integer array sorted in ascending order (may contain duplicates), you need to split them into several subsequences, where each subsequen

[轉+整理]linux shell 將字串分割成陣列

a="one,two,three,four" 要將$a分割開，可以這樣： OLD_IFS="$IFS" IFS="," arr=($a) IFS="$OLD_IFS" for s in ${arr[@]} do echo "$s" done

python 利用pandas將arff檔案轉csv檔案

直接貼程式碼啦： #coding=utf-8 import pandas as pd def arff_to_csv(fpath): #讀取arff資料 if fpath.fin

怎麼將數字轉換成時間

近期做一個專案，後臺給的datetime是一串數字，這時候需要轉換成Date。詳細見程式碼 setContentView(R.layout.activity_main); String datetime = "1423989000"; T

C++ 將字串轉換成date型別的資料

#include <time.h> /* time_t, struct tm, time, localtime, strftime */ #include <string> #include <iostream> #incl

java時間型別的轉換/獲取當前時間/將時間轉換成String/將String轉換成時間

利用java獲取當前的時間(String型別，年-月-日時：分：秒)　　　　　//我要獲取當前的日期 Date date = new Date(); //設定要獲取到什

css將div分割成兩列

在css程式碼中有一組屬性如下： -webkit-column-count: 2; // Chrome, Safari, Opera -moz-column-count: 2; // Firefox column-count: 2; -webkit-colum

根據原始平行資料, 轉換成樹形結構的資料

點選這裡檢視程式碼源資料 var originData = [ { "id":"7", "createDate":"2018-07-26 17:48:43", "updateDate":"2018-07-28 12:06:17",

有關csv格式的資料轉換成libsvm格式的資料

需要傳入一個pandas的DataFrame格式的資料，將其轉換為libsvm格式的資料程式碼如下 # -*- coding: utf-8 -*- """ Created on Sat May 1

python快速將一個dataframe的某一列轉為時間戳

加上庫 from datetime import datetime def time2stamp(cmnttime): #轉時間戳函式 cmnttime=datetime.strptime(cmnttime,'%Y-%m-%d %H:%M:%S') stamp=int(dat

python通過下載連結可以下載成excel，直接將資料寫入資料庫中

from urllib.request import urlopen import sys import datetime import psycopg2 import os # 用來操作資料庫的類 class GPCommand(object): # 類的初始化 def

python 將視訊通過視訊幀轉換成時間

def frames_to_timecode(framerate,frames): """ 視訊通過視訊幀轉換成時間 :param framerate: 視訊幀率 :param frames: 當前視訊幀數 :return:時間（00:00:01:0

MySQL資料庫，將一列資料組合成一行，並以逗號分割

MySQL的資料庫的GROUP_CONCAT函式這一列的資料是這樣的：執行這段SQL： SELECT GROUP_CONCAT(CONCAT('\'',keyword,'\'')) FROM sp_goodimgsinfo where goodid='7

利用python sklearn 將類別資料轉換成one-hot資料

做資料預處理的時候，經常會遇到需要將類別特徵轉換成有意義的數值的情況，通過這樣使類別資料能夠用於後續的分類預測任務。目前應用得最多的就是將其轉換成one-hot編碼。以下是通過sklearn的方法很方便地實現。首先讀取資料： housing = pd.read_csv(

利用python把pandas的DataFrame格式寫入資料庫和讀出資料庫資料

DataFrame <--> sql 嘗試了各種把Excel，csv格式匯入資料庫，卻總是出現各種各樣的額錯誤，後來發現python的pymasql庫不支援 "pd.io.sql.to_sql(data, "file_name", con=engine, index=False,

python Dataframe pandas 將資料分割成時間跨度相等的資料塊

相關推薦