python機器學習：：資料預處理（1）【轉】

阿新 • • 發佈：2018-12-10

轉載自：http://2hwp.com/2016/02/03/data-preprocessing/

常見的資料預處理方法，以下通過sklearn的preprocessing模組來介紹;

1. 標準化（Standardization or Mean Removal and Variance Scaling)

變換後各維特徵有0均值，單位方差。也叫z-score規範化（零均值規範化）。計算方式是將特徵值減去均值，除以標準差。

1	sklearn.preprocessing.scale(X)

一般會把train和test集放在一起做標準化，或者在train集上做標準化後，用同樣的標準化器去標準化test集，此時可以用scaler

1
2
3

scaler = sklearn.preprocessing.StandardScaler().fit(train)
scaler.transform(train)
scaler.transform(test)

實際應用中，需要做特徵標準化的常見情景：SVM

2. 最小-最大規範化

最小-最大規範化對原始資料進行線性變換，變換到[0,1]區間（也可以是其他固定最小最大值的區間）

1 2	min_max_scaler = sklearn.preprocessing.MinMaxScaler() min_max_scaler.fit_transform(X_train)

3.規範化（Normalization）

規範化是將不同變化範圍的值對映到相同的固定範圍，常見的是[0,1]，此時也稱為歸一化。《機器學習》周志華

將每個樣本變換成unit norm。

1 2	X = [[ 1, -1, 2],[ 2, 0, 0], [ 0, 1, -1]] sklearn.preprocessing.normalize(X, norm='l2')

得到：

1	array([[ 0.40, -0.40, 0.81], [ 1, 0, 0], [ 0, 0.70, -0.70]])

可以發現對於每一個樣本都有，0.4^2+0.4^2+0.81^2=1,這就是L2 norm，變換後每個樣本的各維特徵的平方和為1。類似地，L1 norm則是變換後每個樣本的各維特徵的絕對值和為1。還有max norm，則是將每個樣本的各維特徵除以該樣本各維特徵的最大值。

在度量樣本之間相似性時，如果使用的是二次型kernel，需要做Normalization

4. 特徵二值化（Binarization）

給定閾值，將特徵轉換為0/1

1 2	binarizer = sklearn.preprocessing.Binarizer(threshold=1.1) binarizer.transform(X)

5. 標籤二值化（Label binarization）

1	lb = sklearn.preprocessing.LabelBinarizer()

6. 類別特徵編碼

有時候特徵是類別型的，而一些演算法的輸入必須是數值型，此時需要對其編碼。

1
2
3

enc = preprocessing.OneHotEncoder()
enc.fit([[0, 0, 3], [1, 1, 0], [0, 2, 1], [1, 0, 2]])
enc.transform([[0, 1, 3]]).toarray()  #array([[ 1., 0., 0., 1., 0., 0., 0., 0., 1.]])

上面這個例子，第一維特徵有兩種值0和1，用兩位去編碼。第二維用三位，第三維用四位。

7.標籤編碼（Label encoding）

le = sklearn.preprocessing.LabelEncoder()  
le.fit([1, 2, 2, 6]) 
le.transform([1, 1, 2, 6])  #array([0, 0, 1, 2]) 
#非數值型轉化為數值型
le.fit(["paris", "paris", "tokyo", "amsterdam"])
le.transform(["tokyo", "tokyo", "paris"])  #array([2, 2, 1])

8.特徵中含異常值時

1	sklearn.preprocessing.robust_scale

9.生成多項式特徵

這個其實涉及到特徵工程了，多項式特徵/交叉特徵。

1 2	poly = sklearn.preprocessing.PolynomialFeatures(2) poly.fit_transform(X)

原始特徵：

轉化後：

python機器學習：：資料預處理（1）【轉】

轉載自：http://2hwp.com/2016/02/03/data-preprocessing/ 常見的資料預處理方法，以下通過sklearn的preprocessing模組來介紹; 1. 標準化（Standardization or Mean Removal and

機器學習中的資料預處理（sklearn preprocessing）

Standardization即標準化，儘量將資料轉化為均值為零，方差為一的資料，形如標準正態分佈（高斯分佈）。實際中我們會忽略資料的分佈情況，僅僅是通過改變均值來集中資料，然後將非連續特徵除以他們的標準差。sklearn中 scale函式提供了簡單快速的singlearr

【ADNI】資料預處理（1）SPM，CAT12

ADNI Series 1、【ADNI】資料預處理（1）SPM，CAT12 2、【ADNI】資料預處理（2）獲取 subject slices 3、【ADNI】資料預處理（3）CNNs 4、【ADNI】資料預處理（4）Get top k slices according to CNN

資料預處理（1）資料清洗

資料預處理的內容主要包括資料清洗，資料整合，資料變換和資料規約。資料清洗資料清洗主要是刪除原始資料集中的無關資料、重複資料，平滑噪聲資料，帥選掉與挖掘主題無關的資料，處理缺失值、異常值等。缺失值處理缺失值處理的方法可分為三類：刪除記錄、資料插補和不處理。常用的

【ADNI】資料預處理（1）SPM，CAT12；資料集

ADNI Series 1、【ADNI】資料預處理（1）SPM，CAT12 2、【ADNI】資料預處理（2）獲取 subject slices 3、【ADNI】資料預處理（3）CNNs 4、【ADNI】資料預處理（4）Get top k slices accordin

小白學 Python 資料分析（9）：Pandas （八）資料預處理（2）

人生苦短，我用 Python 前文傳送門：小白學 Python 資料分析（1）：資料分析基礎小白學 Python 資料分析（2）：Pandas （一）概述小白學 Python 資料分析（3）：Pandas （二）資料結構 Series 小白學 Python 資料分析（4）：Pandas （三）資

機器學習中的資料預處理

資料的預處理總共可以大致分為6步。匯入需要的庫這兩個是我們每次都需要匯入的庫 Numpy包含數學計算函式 Pandas用於匯入和管理資料集匯入資料集資料集通常是.csv格式。csv檔案以文字形式儲存表格資料。檔案的每一行是一條資料記錄。我們使用pandas的r

機器學習100天——資料預處理(第一天)

有個叫Avik Jain的老外在github上發起了一個100天學習機器學習的專案，每天花一個小時學習機器學習，學習內容由淺入深。今天是第一天，內容是如何進行資料預處理。該教程的程式語言是Python。資料預處理分為6步：第一步：匯入NumPy和Pandas庫。NumPy和Pandas是每次都

程世東老師TensorFlow實戰——個性化推薦，程式碼學習筆記之資料匯入&資料預處理（上）

程式碼來自於知乎:https://zhuanlan.zhihu.com/p/32078473 /程式碼地址https://github.com/chengstone/movie_recommender/blob/master/movie_recommender.ipynb 下一篇有一些資料的

程世東老師TensorFlow實戰——個性化推薦，程式碼學習筆記之資料匯入&資料預處理（下）

這篇主要是進行程式碼中的一些數值視覺化，幫助理解程式碼來自於知乎:https://zhuanlan.zhihu.com/p/32078473 /程式碼地址https://github.com/chengstone/movie_recommender/blob/master/movie_re

資料預處理（3） ——資料歸約使用python（sklearn，pandas，numpy）實現

資料預處理的主要任務有：一、資料預處理 1.資料清洗 2.資料整合 3.資料轉換 4.資料歸約 4.資料歸約資料規約技術可以用來得到資料集的規約表示，它小得多，但仍接近於保持原始資料的完整性。也就是說，在規約後的資料集挖掘將更加有效。（1）資料立方體

【ADNI】資料預處理（6）ADNI_slice_dataloader ||| show image

【ADNI】資料預處理（5）Get top k slices (pMCI_sMCI) according to CNNs

【ADNI】資料預處理（4）Get top k slices according to CNNs

【ADNI】資料預處理（3）CNNs

【ADNI】資料預處理（2）獲取 subject slices

資料預處理（2）資料整合和資料變換資料規約

資料整合資料探勘的過程中往往需要的資料分佈在不同的資料庫，資料整合就是將多個數據源合併存放在一個一致的資料儲存（如資料倉庫）中的過程。實體識別同名異義名字相同但實際代表的含義不同異名同義名字不同但代表的意思相同單位不統一冗餘屬性識別

資料儲存：大資料儲存系統（1）--- 分散式檔案系統

分散式檔案系統一、分散式系統概念（1）分散式系統型別：Client/Server、P2P(Peer-to-Peer)、Master/Worker（2）故障模型（Failure Model）：Fail stop：出現故障時，程序停止/崩潰Fail slow：出現故障時，執行速度

影象資料預處理（下）

1、將彩色影象轉換為灰度圖，其中有三種方法：最大值法、平均值法和各比例法。 (1) 最大值法：就是獲取影象中的每一個畫素值，並且分別獲得畫素的RGB個分量值(GetRValue(COLORREF pixel), GetGValue(COLORREF pixel

神經網路模型無法正常工作時我們應該做什麼（系列）——資料預處理（Preprocess）

前言當你進入深度學習領域，準備好深度神經網路，開始進行訓練時，遇到這樣一個大部分新手都會遇到的問題：你的神經網路沒法正常工作，而你不知道該如何去修正它。你去問你的老闆或者導師，他們也不知道該如何處理，因為在深度神經網路面前，他們和你一樣也是新手。

python機器學習：：資料預處理（1）【轉】

1. 標準化（Standardization or Mean Removal and Variance Scaling)

2. 最小-最大規範化

3.規範化（Normalization）

4. 特徵二值化（Binarization）

5. 標籤二值化（Label binarization）

6. 類別特徵編碼

7.標籤編碼（Label encoding）

8.特徵中含異常值時

9.生成多項式特徵

相關推薦