カーネル密度推定とは?
かーねるみつどすいてい
カーネル密度推定とは、有限個の観測データから確率密度関数を滑らかに推定する統計的手法で、データの分布を可視化・分析する際に用いられます。
カーネル密度推定(KDE: Kernel Density Estimation)は、観測されたデータ点の集合から、そのデータが従う連続的な確率密度関数を推定する非パラメトリック統計手法です。ヒストグラムの問題点(ビン幅・境界の設定によって形状が大きく変わる)を補う手法として広く使われます。
基本的な仕組みは、各データ点を中心に「カーネル関数」と呼ばれる滑らかな関数(通常はガウス関数など)を配置し、それらをすべて足し合わせることで全体の密度曲線を作ります。調整パラメーターのバンド幅(帯域幅)は推定の滑らかさを制御する重要な値で、狭すぎるとデータのノイズを拾いすぎ、広すぎると分布の細部が失われます。
代表的なカーネル関数には次のものがあります。
- ガウスカーネル:正規分布の形状で最も広く使われる
- エパネチニコフカーネル:統計的効率が最適で計算コストも低い
- 一様カーネル:ボックス形状のシンプルな関数
地理情報システム(GIS)では空間上の事象密度(犯罪発生地点・店舗分布など)を可視化するヒートマップの生成に、データ科学ではクラスタリング前処理・異常検知・生成モデルの評価など多方面で応用されています。Pythonのscipyやseabornなどで手軽に実装できます。
使い方・例文
犯罪発生件数を地図上でヒートマップとして表示する場合、カーネル密度推定を使って発生地点の密集度を連続的な色の濃淡で表現します。データ分析では seaborn.kdeplot() などの関数で分布の滑らかな曲線を描くためにも使われます。
この用語をシェア
最終更新: