本文へスキップ

UMAPとは?

ゆーまっぷ

UMAPとは、高次元データを2次元・3次元に圧縮して可視化・分析するための次元削減アルゴリズムで、データの局所的な構造を保ちながら高速に処理できます。

UMAP(Uniform Manifold Approximation and Projection)は、2018年にLeland McInnesらが発表した次元削減アルゴリズムです。多数特徴量を持つ高次元データを人間が視覚的に把握できる2次元や3次元の空間に圧縮し、データのパターンクラスター・外れ値を探索するために使われます。

UMAPは数学的にはリーマン幾何学と位相的データ解析(TDA)の理論を基盤としています。データが高次元空間上の「多様体(マニフォールド)」に沿って分布するという仮定のもと、局所的な近傍関係を保ちながら低次元空間へ射影します。

従来の代表的手法t-SNEと比較したUMAPの主な優位点は次のとおりです。

  • 処理速度:大規模データに対してt-SNEより大幅に高速です。
  • 大域的構造の保持:クラスター間の相対的な位置関係もある程度保持します。
  • 汎用性:次元削減後のデータをそのまま機械学習モデルの前処理として使用できます。

主な活用場面は、単細胞RNA-seq解析(バイオインフォマティクス)・画像特徴量の可視化・自然言語処理における埋め込みベクトルの探索・異常検知などです。PythonではUMAPライブラリ(umap-learn)として提供されており、scikit-learnと親和性の高いAPIで利用できます。

使い方・例文

数千次元の遺伝子発現データをUMAPで2次元に圧縮することで、異なる細胞タイプが別々のクラスターとして可視化され、細胞集団の多様性を直感的に把握できます。

この用語をシェア

𝕏 でポスト LINE

最終更新:

関連用語