一些常用python預處理方法

2023-06-19 21:51:53

轉載自：http://2hwp.com/2016/02/03/data-preprocessing/

常見的資料預處理方法，以下通過sklearn的preprocessing子產品來介紹;

1. 标準化（Standardization or Mean Removal and Variance Scaling)

變換後各維特征有0均值，機關方差。也叫z-score規範化（零均值規範化）。計算方式是将特征值減去均值，除以标準差。

一般會把train和test集放在一起做标準化，或者在train集上做标準化後，用同樣的标準化器去标準化test集，此時可以用scaler

1
2
3

scaler = sklearn.preprocessing.StandardScaler().fit(train)
scaler.transform(train)
scaler.transform(test)

實際應用中，需要做特征标準化的常見情景：SVM

2. 最小-最大規範化

最小-最大規範化對原始資料進行線性變換，變換到[0,1]區間（也可以是其他固定最小最大值的區間）

1
2

min_max_scaler = sklearn.preprocessing.MinMaxScaler()
min_max_scaler.fit_transform(X_train)

3.規範化（Normalization）

規範化是将不同變化範圍的值映射到相同的固定範圍，常見的是[0,1]，此時也稱為歸一化。《機器學習》周志華

将每個樣本變換成unit norm。

1
2

X = [[ 1, -1, 2],[ 2, 0, 0], [ 0, 1, -1]]
sklearn.preprocessing.normalize(X, norm='l2')

得到：

可以發現對于每一個樣本都有，0.4^2+0.4^2+0.81^2=1,這就是L2 norm，變換後每個樣本的各維特征的平方和為1。類似地，L1 norm則是變換後每個樣本的各維特征的絕對值和為1。還有max norm，則是将每個樣本的各維特征除以該樣本各維特征的最大值。

在度量樣本之間相似性時，如果使用的是二次型kernel，需要做Normalization

4. 特征二值化（Binarization）

給定門檻值，将特征轉換為0/1

1
2

binarizer = sklearn.preprocessing.Binarizer(threshold=1.1)
binarizer.transform(X)

5. 标簽二值化（Label binarization）

6. 類别特征編碼

有時候特征是類别型的，而一些算法的輸入必須是數值型，此時需要對其編碼。

1
2
3

enc = preprocessing.OneHotEncoder()
enc.fit([[0, 0, 3], [1, 1, 0], [0, 2, 1], [1, 0, 2]])
enc.transform([[0, 1, 3]]).toarray()  #array([[ 1., 0., 0., 1., 0., 0., 0., 0., 1.]])

上面這個例子，第一維特征有兩種值0和1，用兩位去編碼。第二維用三位，第三維用四位。

另一種編碼方式

newdf=pd.get_dummies(df,columns=["gender","title"],dummy_na=True)

7.标簽編碼（Label encoding）

le = sklearn.preprocessing.LabelEncoder()  
le.fit([1, 2, 2, 6]) 
le.transform([1, 1, 2, 6])  #array([0, 0, 1, 2]) 
#非數值型轉化為數值型
le.fit(["paris", "paris", "tokyo", "amsterdam"])
le.transform(["tokyo", "tokyo", "paris"])  #array([2, 2, 1])

8.特征中含異常值時

9.生成多項式特征

這個其實涉及到特征工程了，多項式特征/交叉特征。

1
2

poly = sklearn.preprocessing.PolynomialFeatures(2)
poly.fit_transform(X)

原始特征：

一些常用python預處理方法

轉化後：

一些常用python預處理方法

一些常用python預處理方法

1. 标準化（Standardization or Mean Removal and Variance Scaling)

2. 最小-最大規範化

3.規範化（Normalization）

4. 特征二值化（Binarization）

5. 标簽二值化（Label binarization）

6. 類别特征編碼

7.标簽編碼（Label encoding）

8.特征中含異常值時

9.生成多項式特征

繼續閱讀

XGBoost Plotting API以及GBDT組合特征實踐 XGBoost Plotting API以及GBDT組合特征實踐

解碼器用于語義分割：資料依賴的解碼可以實作靈活的特征聚合

YAML簡介和PyYAML安全操作YAML支援的類型YAML的優點：yaml的基本文法python操作

2021-2025年中國運動療法（KT）帶行業市場供需與戰略研究報告

Small tricks

libsvm for python 安裝

學習軟體測試基礎測試第七天

Zeppelin 配置通路 REST APIApache Zeppelin Configuration REST API

【Torch】最簡潔logging使用指南

27. Remove Element(清單)題目代碼

Cloud Studio初體驗

使用 ctypes 進行 Python 和 C 的混合程式設計

【python】【資料處理】畫多元資料分布圖

【python】netconf協定對接管理裝置

「Python 網絡自動化」NETCONF —— Python 使用 NETCONF 管理配置 H3C 網絡裝置

在python中建立excel并寫入