UMAPは、高次元データを低次元空間に圧縮して可視化や解析を容易にする次元削減アルゴリズムです。データの局所的な構造だけでなく大域的な構造も保持しつつ高速に計算できるため、t-SNEの代替手法として機械学習やバイオインフォマティクスなどの分野で広く活用されています。
UMAPとは
UMAPとは、複雑な高次元データを、その関係性を保ったまま2次元や3次元などの低次元に写像し、視覚化や機械学習の前処理に用いる手法のことです。
詳しく解説
UMAPは「Uniform Manifold Approximation and Projection」の略称です。数学的にはリーマン幾何学やファジィ集合論の理論をベースに構築されています。高次元空間にあるデータ点が描く多様体を低次元空間へ投影する際、近傍にあるデータ点同士の関係性を重視しつつ、データ全体の大域的な広がりも同時に保持しようとします。従来の代表的な手法であるt-SNEと比較して計算速度が大幅に速く、大規模なデータセットに対しても効率よく適用できる点が大きな特徴であり、現代のデータサイエンスにおいて欠かせない技術となっています。
具体例・使われ方
シングルセルRNAシーケンスなどの遺伝子発現データの解析において、細胞の種類ごとにデータをクラスタリングして2次元プロット上に可視化する際によく利用されます。また、画像認識や自然言語処理の分野で得られた高次元の埋め込みベクトルを可視化し、モデルが正しく概念を学習できているかを検証する際にも活用されます。
似た用語との違い
次元削減の代表例であるt-SNEと比較されることが多いです。t-SNEは局所的な構造の保持に優れている一方、計算量が大きく、大域的なデータ全体の配置関係が失われやすいという弱点があります。これに対し、UMAPは局所構造と大域構造のバランスを取りつつ、高速に計算できるというメリットがあります。また、PCAとは異なり、非線形なデータの複雑な関係性を捉えることができます。
注意点
UMAPによって得られた2次元や3次元の座標上の距離や配置は、アルゴリズムのパラメータ設定や非線形変換の性質に大きく依存するため、過信しすぎない注意が必要です。特に、異なるクラスタ間の物理的な距離が必ずしも元の高次元空間における実際の遠さを正確に反映しているとは限らないため、解釈には慎重な判断が求められます。