階層的クラスタリングとは?
かいそうてきくらすたりんぐ
階層的クラスタリングとは、データ間の類似度をもとにデータを段階的にまとめていき、ツリー状の階層構造としてクラスターを表現するデータ分析手法です。
階層的クラスタリングは、事前にクラスター数を指定せずにデータを分類できる教師なし機械学習手法の一つです。分析結果はデンドログラム(樹形図)として可視化され、どのデータ同士が近い関係にあるかを直感的に把握できます。
アルゴリズムには大きく二つの方向性があります。
- 凝集型(ボトムアップ):各データ点を1つのクラスターとして出発し、最も類似度が高い2つを順番に統合していく。最も広く使われる方法です。
- 分割型(トップダウン):全データを1つのクラスターとし、逐次分割していく。
クラスター間の距離(類似度)をどう定義するかで結果が異なり、代表的な連結法としてウォード法・完全連結法・平均連結法・単連結法があります。ウォード法はクラスター内分散を最小化するため、均一なサイズのまとまりが得られやすいとされます。
階層的クラスタリングはデータ数が増えると計算量が大きくなる(一般にO(n²)〜O(n³))ため、大規模データには向きませんが、クラスター数の決定が難しい探索的分析や、階層関係の可視化が目的の場合に特に有効です。生物の系統樹解析、顧客セグメント分析、テキストのトピック分類など幅広い分野で利用されています。
使い方・例文
ECサイトで購買履歴をもとに顧客を分類する際、階層的クラスタリングを使うとデンドログラムから「どの顧客グループが互いに似ているか」を視覚的に確認しながら適切なクラスター数を選べます。
この用語をシェア
最終更新: