データ分析機械学習統計学

カーネル密度推定

かーねるみつどすいてい · Kernel Density Estimation
2 views

カーネル密度推定(KDE)とは、観測されたデータからその背景にある連続的な確率分布を滑らかに推定する非パラメトリック手法です。ヒストグラムのようにデータを区切る位置に依存せず、各データ点にカーネル関数を配置して重ね合わせることで、データ全体の確率密度関数を滑らかに表現できます。

カーネル密度推定とは

カーネル密度推定を一言でいうと、限られたデータから全体的なデータの分布の形状を滑らかに推測する手法です。

詳しく解説

従来データの分布を確認する際にはヒストグラムが使われてきましたが、階級の幅や区切る位置によってグラフの見た目が大きく変わる問題がありました。カーネル密度推定は、データの一つひとつにカーネル関数と呼ばれる滑らかな山型の関数を配置し、それらを足し合わせることで連続した確率密度関数を算出します。分布の滑らかさはバンド幅と呼ばれるハイパーパラメータによって調整され、データの背後にある本質的なパターンを視覚化・分析する上で重要な役割を果たします。

具体例・使われ方

例えば、機械学習における異常検知では、正常データの発生確率をカーネル密度推定でモデル化し、確率が極めて低いデータを異常値として判定します。また、画像処理での領域分割や、地理データにおける犯罪・事故の発生密度マップ作成など、データの偏りを可視化する際にも広く活用されます。

似た用語との違い

ヒストグラムとの違いは、データを区切る境界の選択に左右されず、滑らかな曲線で分布を表現できる点です。また、正規分布などを仮定するパラメトリック手法とは異なり、カーネル密度推定は事前に入力データの分布形状を仮定しない非パラメトリック手法であるため、より柔軟に実データをモデル化できます。

注意点

カーネル密度推定では、バンド幅の設定が過学習や過度な平滑化を引き起こすため適切なチューニングが必要です。また、データの次元数が高くなると必要なデータ量が爆発的に増加する「次元の呪い」の影響を受けやすいため、高次元データへの直接適用には注意が必要です。

更新日時: 2026年9月2日 18:31