（R/Python）t-SNE聚類演算法實踐指南

阿新 • • 發佈：2019-02-11

首發連結：

https://yq.aliyun.com/articles/70733

作者介紹：Saurabh.jaju2

Saurabh是一名資料科學家和軟體工程師，熟練分析各種資料集和開發智慧應用程式。他目前正在加州大學伯克利分校攻讀資訊和資料科學碩士學位，熱衷於開發基於資料科學的智慧資源管理系統。

介紹

許多資料科學家經常面對的問題之一：假設有一個包含數百個特徵（變數）的資料集，且對資料所屬的域沒有任何瞭解，需要對該資料集識別其隱藏狀態、探索並分析。本文將介紹一種非常強大的方法來解決該問題。

關於PCA

現實中大多數人會使用PCA進行降維和視覺化，但為什麼不選擇比PCA更先進的東西呢？關於

PCA的介紹可以閱讀該文獻。本文講解比PCA（1933）更有效的演算法t-SNE（2008）。

本文內容

1 什麼是t-SNE？

2 什麼是降維？

3 t-SNE如何在維數降低演算法空間中擬合

4 t-SNE演算法的細節

5 t-SNE實際上是做什麼？

6 用例

7 t-SNE與其他降維演算法相比

8 示例實現

R語言

Python語言

9 應用方面

資料科學家

機器學習駭客

資料科學愛好者

10 常見錯誤

1 什麼是t-SNE

（t-SNE）t分佈隨機鄰域嵌入是一種用於探索高維資料的非線性降維演算法。它將多維資料對映到適合於人類觀察的兩個或多個維度。

46439e36cf281fdeb199dcb16c2b723b9a08194b

2 什麼是降維？

簡而言之，降維就是用2維或3維表示多維資料（彼此具有相關性的多個特徵資料）的技術，利用降維演算法，可以顯式地表現資料。

3 t-SNE如何在降維演算法空間中擬合

常用的降維演算法有：

1 PCA（線性）

2 t-SNE（非引數/非線性）

3 Sammon對映（非線性）

4 Isomap（非線性）

5 LLE（非線性）

6 CCA（非線性）

7 SNE（非線性）

8 MVU（非線性）

9 拉普拉斯特徵圖（非線性）

只需要研究上述演算法中的兩種——PCA和t-SNE。

PCA的侷限性

PCA是一種線性演算法，它不能解釋特徵之間的複雜多項式關係。而

t-SNE是基於在鄰域圖上隨機遊走的概率分佈來找到資料內的結構。

線性降維演算法的一個主要問題是不相似的資料點放置在較低維度表示為相距甚遠。但為了在低維度用非線性流形表示高維資料，相似資料點必須表示為非常靠近，這不是線性降維演算法所能做的。

4 t-SNE演算法的細節

4.1 演算法

步驟1：

隨機鄰接嵌入（SNE）通過將資料點之間的高維歐幾里得距離轉換為表示相似性的條件概率而開始，資料點xi、xj之間的條件概率pj|i由下式給出：

7865f9e80ece98a016f0e310ea8fa8e14c3a9db9

其中σi是以資料點xi為中心的高斯方差。

步驟2：

對於高維資料點xi和xj的低維對應點yi和yj而言，可以計算類似的條件概率qj|i

def3073e7fff9a1f12327ef0914efb8a889da3b7

SNE試圖最小化條件概率的差異。

步驟3：

為了測量條件概率差的和最小值，SNE使用梯度下降法最小化KL距離。而SNE的代價函式關注於對映中資料的區域性結構，優化該函式是非常困難的，而t-SNE採用重尾分佈，以減輕擁擠問題和SNE的優化問題。

步驟4：

定義困惑度：

51f1f11d693d4b520d5d74182ccb79e9dd39a8a1

其中H(Pi)是夏農熵

160b3cbd31d9015af253dc1ee1d260d27f47d363

4.2 時間和空間複雜性

演算法計算對應的是條件概率，並試圖最小化較高和較低維度的概率差之和，這涉及大量的計算，對系統資源要求高。t-SNE的複雜度隨著資料點數量有著時間和空間二次方。

5 t-SNE實際上是做什麼？

t-SNE非線性降維演算法通過基於具有多個特徵的資料點的相似性識別觀察到的簇來在資料中找到模式。本質上是一種降維和視覺化技術。另外t-SNE的輸出可以作為其他分類演算法的輸入特徵。

6用例

t-SNE可用於幾乎所有高維資料集，廣泛應用於影象處理，自然語言處理，基因組資料和語音處理。例項有：面部表情識別[2]、識別腫瘤亞群[3]、使用wordvec進行文字比較[4]等。

7 t-SNE與其他降維演算法相比

基於所實現的精度，將t-SNE與PCA和其他線性降維模型相比，結果表明t-SNE能夠提供更好的結果。這是因為演算法定義了資料的區域性和全域性結構之間的軟邊界。

8示例實現

在MNIST手寫數字資料庫上實現t-SNE演算法。

1 R語言

“Rtsne”包在R中具有t-SNE的實現。“Rtsne”包可以使用在R控制檯中鍵入的以下命令安裝在R中：

超引數調整

725ecc927935b13a2f9859a69c0e36cb9139577c

程式碼

MNIST資料可從MNIST網站下載，並可轉換為具有少量程式碼的csv檔案。

## calling the installed package
train<‐ read.csv(file.choose()) ## Choose the train.csv file downloaded from the link above
library(Rtsne)
## Curating the database for analysis with both t‐SNE and PCA
Labels<‐train$label
train$label<‐as.factor(train$label)
## for plotting
colors = rainbow(length(unique(train$label)))
names(colors) = unique(train$label)
## Executing the algorithm on curated data
tsne <‐ Rtsne(train[,‐1], dims = 2, perplexity=30, verbose=TRUE, max_iter = 500)
exeTimeTsne<‐ system.time(Rtsne(train[,‐1], dims = 2, perplexity=30, verbose=TRUE, max_iter = 50
0))
## Plotting
plot(tsne$Y, t='n', main="tsne")
text(tsne$Y, labels=train$label, col=colors[train$label])

實現時間

6242f88cd410239964ad1bdc3fe8564fc39f0bcd

可以看出，與PCA相比，t-SNE在相同樣本大小的資料上執行需要相當長的時間。

解釋結果

以下圖用於探索性分析。輸出x和y座標以及成本可以用作分類演算法中的特徵。

f7adb3c74a84ba93145761d39e280574950e5a02

d0414d3247882ae47781c11549cdfc629bec7f89

2 Python語言

t-SNE演算法可以從sklearn包中訪問。

超引數調整

fce0dc4f4df4e8c9f523dfb0bc3b9e78ed621054

程式碼

以下程式碼來自sklearn網站上的sklearn示例。

程式碼1

實現時間

## importing the required packages
from time import time
import numpy as np
import matplotlib.pyplot as plt
from matplotlib import offsetbox
from sklearn import (manifold, datasets, decomposition, ensemble,
discriminant_analysis, random_projection)
## Loading and curating the data
digits = datasets.load_digits(n_class=10)
X = digits.data
y = digits.target
n_samples, n_features = X.shape
n_neighbors = 30
## Function to Scale and visualize the embedding vectors
def plot_embedding(X, title=None):
x_min, x_max = np.min(X, 0), np.max(X, 0)
X = (X ‐ x_min) / (x_max ‐ x_min)
plt.figure()
ax = plt.subplot(111)
for i in range(X.shape[0]):
plt.text(X[i, 0], X[i, 1], str(digits.target[i]),
color=plt.cm.Set1(y[i] / 10.),
fontdict={'weight': 'bold', 'size': 9})
if hasattr(offsetbox, 'AnnotationBbox'):
## only print thumbnails with matplotlib > 1.0
shown_images = np.array([[1., 1.]]) # just something big
for i in range(digits.data.shape[0]):
dist = np.sum((X[i] ‐ shown_images) ** 2, 1)
if np.min(dist) < 4e‐3:
## don't show points that are too close
continue
shown_images = np.r_[shown_images, [X[i]]]
imagebox = offsetbox.AnnotationBbox(
offsetbox.OffsetImage(digits.images[i], cmap=plt.cm.gray_r),
X[i])
ax.add_artist(imagebox)
plt.xticks([]), plt.yticks([])
if title is not None:
plt.title(title)
#‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐‐
## Plot images of the digits
n_img_per_row = 20
img = np.zeros((10 * n_img_per_row, 10 * n_img_per_row))
for i in range(n_img_per_row):
ix = 10 * i + 1
for j in range(n_img_per_row):
iy = 10 * j + 1
img[ix:ix + 8, iy:iy + 8] = X[i * n_img_per_row + j].reshape((8, 8))
plt.imshow(img, cmap=plt.cm.binary)
plt.xticks([])
plt.yticks([])
plt.title('A selection from the 64‐dimensional digits dataset')
## Computing PCA
print("Computing PCA projection")
t0 = time()
X_pca = decomposition.TruncatedSVD(n_components=2).fit_transform(X)
plot_embedding(X_pca,
"Principal Components projection of the digits (time %.2fs)" %
(time() ‐ t0))
## Computing t‐SNE
print("Computing t‐SNE embedding")
tsne = manifold.TSNE(n_components=2, init='pca', random_state=0)
t0 = time()
X_tsne = tsne.fit_transform(X)
plot_embedding(X_tsne,
"t‐SNE embedding of the digits (time %.2fs)" %
(time() ‐ t0))
plt.show()

116a56b7db93ebc18b3c34f0003e0a1f6bf1f5a9

468bdfdb8d8163443c8a338717b2519cccb27d72

9 應用方面

9.1資料科學家

對於資料科學家來說，使用t-SNE的主要問題是演算法的黑盒型別性質。使用該演算法的最佳方法是將其用於探索資料分析。

9.2機器學習駭客

將資料集縮減為2或3維，並使用非線性堆疊器將其堆疊。可以使用XGboost提高t-SNE向量以獲得更好的結果。

9.3資料科學愛好者

對於開始使用資料科學的資料科學愛好者來說，這種演算法在研究和效能增強方面提供了最好的機會。針對各種NLP問題和影象處理應用方面實施t-SNE的研究是一個尚未開發的領域。

10常見錯誤

以下是在解釋t-SNE的結果時要避免的幾個常見錯誤：

1 為了使演算法正確執行，困惑度應小於點的數量。一般設定為5-50。

2 具有相同超引數的不同執行可能產生不同的結果。

3 任何t-SNE圖中的簇大小不得用於標準偏差，色散或任何其他類似的評估。

4 簇之間的距離可以改變。一個茫然性不能優化所有簇的距離。

5 可以在隨機噪聲中找到模式。

6 不同的困惑水平可以觀察到不同的簇形狀。

7 不能基於單個t-SNE圖進行分析拓撲，在進行任何評估之前必須觀察多個圖。

文章原標題《Comprehensive Guide on t-SNE algorithm with implementation in R & Python》，作者：Saurabh，譯者：海棠

文章為簡譯，更為詳細的內容，請檢視原文

（R/Python）t-SNE聚類演算法實踐指南

首發連結： https://yq.aliyun.com/articles/70733 作者介紹：Saurabh.jaju2 Saurabh是一名資料科學家和軟體工程師，熟練分析各種資料集和開發智慧應用程式。他目前正在加州大學伯克利分校攻讀資訊和資料科學碩士學位，熱衷

[機器學習]t-SNE聚類演算法實踐指南

Saurabh是一名資料科學家和軟體工程師，熟練分析各種資料集和開發智慧應用程式。他目前正在加州大學伯克利分校攻讀資訊和資料科學碩士學位，熱衷於開發基於資料科學的智慧資源管理系統。介紹許多資料科學家經常面對的問題之一：假設有一個包含數百個特徵（變數）的資料集，且對資料所屬的域沒有任何瞭解，需要對該資

聚類演算法實踐（一）——層次聚類、K-means聚類

因為百度雲的文章裡面有些圖片丟失了，想起這篇東西之前被一箇中國統計網轉發過，所以自己搜了一下想直接把圖搞回來，結果發現到處轉載的也有不少，自己現在發倒好像是抄襲似的。其實這篇文章裡面特別有價值的東西不算太多，PCCA算是一個知道的人不多而且也挺有意義的演算法，譜

機器學習總結（十）：常用聚類演算法（Kmeans、密度聚類、層次聚類）及常見問題

任務：將資料集中的樣本劃分成若干個通常不相交的子集。效能度量：類內相似度高，類間相似度低。兩大類：1.有參考標籤，外部指標；2.無參照，內部指標。距離計算：非負性，同一性（與自身距離為0），對稱性

基礎演算法（二）：Kmeans聚類演算法的基本原理與應用

Kmeans聚類演算法的基本原理與應用內容說明：主要介紹Kmeans聚類演算法的數學原理，並使用matlab程式設計實現Kmeans的簡單應用，不對之處還望指正。一、Km

機器學習sklearn19.0聚類演算法——層次聚類（AGNES/DIANA）、密度聚類(DBSCAN/MDCA)、譜聚類

一、層次聚類 BIRCH演算法詳細介紹以及sklearn中的應用如下面部落格連結： http://www.cnblogs.com/pinard/p/6179132.html http://www.cnblogs.com/pinard/p/62

機器學習（二）——K均值聚類演算法（K-means）

概述： 1.聚類 “類”指的是具有相似性的集合。聚類是指將資料集劃分為若干類，使得類內之間的資料最為相識，各類之間的資料相似度差別儘可能大。聚類分析就是以相似性為基礎，對資料集進行聚類分析，屬於無監督學習。 2.無監督學習和監督學習 k-均值聚類（k-means）與k-近鄰（knn）

聚類演算法實踐（四）——演算法總結

前面的文章裡總共提到了7種聚類演算法，我們就會情不自禁地想知道，哪一種是“最好”的聚類演算法？正如我在一開始就提到，聚類實際上是由使用者來給定規則，從而實現分類的。所以所謂“最好”的聚類演算法，就應該是那個聚類規則“最能反映系統特徵”的演算法（當然，

機器學習（2）：DBSCAN聚類演算法

一、DBSCAN演算法基本概念 1.全稱：Density-Based Spatial Clustering of Applications with Noise 基於密度帶有噪聲聚類 2.核心物件：若某個點的密度達到演算法設定的閾值則其為核心點。（即某點的r 鄰域內，點的數量不小於設定閾值 m

模糊聚類演算法（FCM）和硬聚類演算法（HCM)的VB6.0實現及其應用

Private Function Fcm(ByRef Data() As Double, ByVal Cluster As Long, Optional ByVal CreateIniCenter As IniCenterMethod = IniCenterMethod.CreateByHcm, Option

利用梅爾倒譜系數（MFCC）及空間聚類演算法實現音色識別

寫在前面 2016年4月參加了哈爾濱工業大學深圳研究生院舉辦的創新創業比賽，司職演算法組長，切入點定在了音色識別和相似明星音才藝展示推薦演算法上，不才，拿到了一等獎，趁佳節未散與大家分享。專案進度安排 2016年1月~2016年3月：前期工作中瞭解學習了語音訊號處理的基本

python實現mean-shift聚類演算法

新建MeanShift.py檔案 import numpy as np # 定義預先設定的閾值 STOP_THRESHOLD = 1e-4 CLUSTER_THRESHOLD = 1e-1 # 定義度量函式 def distance(a, b):

Python實現K-Means聚類演算法

宣告：程式碼的執行環境為Python3。Python3與Python2在一些細節上會有所不同，希望廣大讀者注意。本部落格以程式碼為主，程式碼中會有詳細的註釋。相關文章將會發布在我的個人部落格專欄《Python從入門到深度學習》，歡迎大家關注~

python資料分析：聚類分析（cluster analysis）

何為聚類分析聚類分析或聚類是對一組物件進行分組的任務，使得同一組（稱為聚類）中的物件（在某種意義上）與其他組（聚類）中的物件更相似（在某種意義上）。它是探索性資料探勘的主要任務，也是統計資料分析的常用技術，用於許多領域，包括機器學習，模式識別，影象分析，資訊檢索，生物資訊學，資料

基於R的聚類分析（DBSCAN，基於密度的聚類分析）

DBSCAN聚類分析（基於R語言）在上一講中，主要是給大家介紹了，K-means聚類，層次聚類這兩種聚類方法是最為典型的兩種聚類方法。K-means聚類基本原理是這樣的，在n個樣本點中，首先提前設定要聚類幾類，比如說要聚成三類，那麼在n個樣本點中先隨機選擇三

用Python開始機器學習（10：聚類演算法之K均值）

我們之前接觸的所有機器學習演算法都有一個共同特點，那就是分類器會接受2個向量：一個是訓練樣本的特徵向量X，一個是樣本實際所屬的型別向量Y。由於訓練資料必須指定其真實分類結果，因此這種機器學習統稱為有監督學習。然而有時候，我們只有訓練樣本的特徵，而對其型別一無所知。這種情況，我

鳶尾花三種聚類演算法（K-means,AGNES,DBScan）的python實現

一.分散性聚類(kmeans) 演算法流程: 1.選擇聚類的個數k. 2.任意產生k個聚類，然後確定聚類中心，或者直接生成k箇中心。 3.對每個點確定其聚類中心點。 4.再計算其聚類新中心。 5.重複以上步驟直到滿足收斂要求。（通常就是確定的中心點不再改變。

文字聚類演算法之一趟聚類（One-pass Cluster）演算法的python實現

一、演算法簡介一趟聚類演算法是由蔣盛益教授提出的無監督聚類演算法，該演算法具有高效、簡單的特點。資料集只需要遍歷一遍即可完成聚類。演算法對超球狀分佈的資料有良好的識別，對凸型資料分佈識別較差。一趟聚類可以在大規模資料，或者二次聚類中，或者聚類與其他演算法結合的情況下，發

機器學習經典聚類演算法 —— k-均值演算法（附python實現程式碼及資料集）

目錄工作原理 python實現演算法實戰對mnist資料集進行聚類小結附錄工作原理聚類是一種無監督的學習，它將相似

python聚類演算法解決方案（rest介面/mpp資料庫/json資料/下載圖片及資料）

1. 場景描述一直做java，因專案原因，需要封裝一些經典的演算法到平臺上去，就一邊學習python，一邊網上尋找經典演算法程式碼，今天介紹下經典的K-means聚類演算法，演算法原理就不介紹了，只從程式碼層面進行介紹，包含：rest介面、連線mpp資料庫、回傳json資料、下載圖片及資料。 2. 解決方案

（R/Python）t-SNE聚類演算法實踐指南

文章原標題《Comprehensive Guide on t-SNE algorithm with implementation in R & Python》，作者：Saurabh，譯者：海棠

文章為簡譯，更為詳細的內容，請檢視原文

相關推薦