python的等深分箱例項
阿新 • • 發佈:2020-01-09
背景
當前很多文章嘗試過最優分箱,python上也有cut等方法進行等寬分箱。為了方便日後輸出結果以及分箱要求。做一個簡單的輪子以供大家日後使用。很多能用其他輪子的地方也沒有多餘出力,也不託大會比別人寫的好。空間複雜度盡我所能。
方法展示
話不多說上程式碼。
以下為等深分箱以及encoding方法
# -*- coding: utf-8 -*- """ Created on Tue Jan 29 17:26:38 2019 @author: DamomWCG """ class Equal_depth_box: def equal_box(list,bin_num): ''' param: list:you need bin box list bin_num: you want bin num ''' bin_num = 10 list.sort() #need sort can replace by others list_2 = list.copy() all_num = len(list_2) bin_sep = all_num/bin_num bin_sep = int(bin_sep) bin_list = [] for i in range(1,bin_num): bin_dict = {} bin_dict = i*bin_sep bin_list.append(bin_dict) bin_real_list = [] for i in bin_list: #print(i) bin_real_dict = {} bin_real_dict = list[i] bin_real_list.append(bin_real_dict) return bin_real_list def replace_box(list_1,replace_list): ''' param: list_1:you need bin list replace_list: from equal box,replace the original list ''' import pandas as pd list_max = max(list_1) list_min = min(list_1) replace_list.insert(0,list_min -1) #insert start replace_list.append(list_max + 1) #insert end list_2 = pd.cut(list_1,bins = replace_list,labels = range(len(replace_list) - 1)).tolist() return list_2 if __name__ == '__main__': import random list_1 = random.sample(range(1000),134) print(list_1.sort()) print('real_list: {}'.format(list_1[0:50])) replace_list = bin_class.equal_box(list_1,10) list_2 = bin_class.replace_box(list_1,replace_list) print('encode_list: {}'.format(list_2[0:50]))
原始git地址
https://github.com/DamonWCG/Equal_depth_box/blob/master/Equal_depth_box
使用案例
本案例資料為,我進行過一步的最優分箱,來做一步等深分箱來進行橫向對比。
原始資料形式
具體案例
# -*- coding: utf-8 -*- """ Created on Wed Jan 30 16:17:19 2019 @author: DamonWCG """ from Equal_depth_box import * import pandas as pd df = pd.read_csv('test.csv',encoding = 'gbk') df.columns ####需要分箱的列 list_1 = df['deal_city_encoding'].tolist() #本方法是針對於list,所以對於series需要進行變換 ####需要分箱的個數 replace_list = Equal_depth_box.equal_box(list_1,5) ####替代的名稱 ##因為列表排序所以需要重新排序對齊,這裡我有空再想想其他辦法 df.sort_values(by="deal_city_encoding",inplace = True) list_2 = Equal_depth_box.replace_box(list_1,replace_list) df['deal_city_bin_encoding'] = list_2 df.to_csv('df.csv',encoding = 'gbk',index = False)
本方法現階段encoding形式為數字型。
分箱最終結果形式
需要注意,我得列表形式重新decode時候需要按照當前排序陣列重新編碼,這個問題我年後會解決。
以上這篇python的等深分箱例項就是小編分享給大家的全部內容了,希望能給大家一個參考,也希望大家多多支援我們。