t-SNE(t分布型確率的近傍埋め込み)とは、高次元データを2次元や3次元の低次元空間に圧縮して可視化するための代表的な次元削減アルゴリズムです。高次元空間におけるデータ点同士の局所的な類似度(近接性)を確率的に捉え、低次元空間でもその局所構造を極力維持するように配置します。主にデータ可視化の用途で機械学習やデータ分析に利用されます。
t-SNEとは
t-SNEは、高次元データの特徴や構造を損なわずに2次元や3次元の平面上に落とし込んで表示する、データ可視化に特化した非線形の次元削減手法です。
詳しく解説
t-SNEは「t-Distributed Stochastic Neighbor Embedding(t分布型確率的近傍埋め込み)」の略称です。従来の線形手法では困難だった、複雑な非線形関係を持つ高次元データの局所的な密集度やクラスター構造の把握に長けています。アルゴリズムの仕組みとして、まず高次元空間においてデータ点間の距離をガウス分布に基づいた類似度(確率)に変換します。次に、低次元空間における点同士の類似度を裾の重いt分布で定義し、両方の空間における確率分布の差異(カルバック・ライブラー情報量)が最小になるよう勾配降下法などで位置を最適化します。t分布を用いることで、低次元に圧縮した際にデータ点が中心に固まりすぎる「クロウディング問題」を解決できる点が重要な特徴です。
具体例・使われ方
具体的な利用例として、大量の画像データや自然言語処理における単語埋め込みベクトルのクラスタリング状況を確認するデータ可視化が挙げられます。例えば、手書き数字データベース(MNIST)の画像から抽出した高次元データをt-SNEで2次元に可視化すると、同じ数字(0から9)のデータ点が自然とグループ(クラスター)を形成して点在する様子を直感的に観察できます。
似た用語との違い
主成分分析(PCA)はデータ全体の分散(大局的な構造)を保つ線形の次元削減手法ですが、t-SNEはデータ同士の近さ(局所的な構造)を優先して保つ非線形の手法です。そのため、複雑な曲面構造を持つデータに対してはt-SNEの方がクラスターをきれいに分離できます。また、より新しい非線形次元削減手法であるUMAPと比較した場合、t-SNEは計算時間が比較的長く、大局的な位置関係の保持能力においてはUMAPに譲る場面があります。
注意点
t-SNEは主にデータ可視化のための手法であり、新しい未知のデータに対する事前予測モデルとして適用(transform)するのは困難です。また、ハイパーパラメータであるパープレキシティ(Perplexity)の設定によって可視化結果のグループの形が大きく変わるため、距離や密度の絶対的な違いをそのまま真の値として解釈しないよう注意が必要です。低次元空間上での大局的なクラスター間の距離には必ずしも物理的な意味がない場合があります。