機械学習統計学

ガウス混合モデル

がうすこんごうモデル · Gaussian Mixture Model
1 views

ガウス混合モデル(GMM)は、複数の正規分布(ガウス分布)を組み合わせて複雑なデータ分布を表現する確率モデルです。データが複数の異なるグループから構成されていると仮定し、それぞれのグループが独自の平均と分散を持つガウス分布に従うと考えます。主にクラスタリングや異常検知、密度推定などのタスクで広く用いられています。

ガウス混合モデルとは

ガウス混合モデル(GMM)は、データ全体が複数の異なる「正規分布(ガウス分布)」の組み合わせ(混合)によって構成されていると仮定する確率モデルです。各データ点がいずれの分布から発生したかという確率(帰属度)を算出することで、データのクラスタリングや密度推定を行うことができます。

詳しく解説

ガウス混合モデルは、教師なし学習に分類される手法です。単一の正規分布では表現できないような、複数の山(多峰性)を持つ複雑なデータ分布を近似するのに適しています。モデルのパラメータ(各正規分布の平均、分散、および各分布が選ばれる重み)の推定には、一般にEMアルゴリズム(期待値最大化法)が用いられます。EMアルゴリズムは、データ点があるクラスに属する確率(ソフトクラスタリング)を計算する「Eステップ」と、その確率に基づいてパラメータを更新する「Mステップ」を交互に繰り返すことで、対数尤度を最大化します。これにより、データが曖昧な境界線上にある場合でも確率的な解釈が可能になります。

具体例・使われ方

具体的な応用例として、顧客データのクラスタリングが挙げられます。購買傾向や年齢層から、明確な境界で分けるのではなく「グループAに属する確率が70%、グループBに属する確率が30%」といった柔軟なセグメンテーションが可能です。他にも、画像処理における背景差分法(動画像から背景と移動物体を分離する技術)や、音声認識における音響モデルの構築、さらには正常なデータの分布から大きく外れたデータを検出する異常検知にも広く利用されています。

似た用語との違い

混同されやすい概念としてk-means法があります。k-means法は、各データ点をもっとも近い代表点(重心)のクラスに厳密に割り当てるハードクラスタリングを行います。また、クラスタの形状が球状であることを前提としています。これに対して、ガウス混合モデルは確率的な割り当てを行うソフトクラスタリングであり、分散共分散行列を調整することで楕円など多様な形状のクラスタにも柔軟に対応できる点が異なります。ただし、パラメータ数が多いためk-means法に比べて計算負荷は高くなります。

注意点

ガウス混合モデルの注意点として、EMアルゴリズムが局所最適解(ローカルミニマ)に陥りやすい点が挙げられます。初期値の設定によって最終的なクラスタリング結果が大きく変わる可能性があるため、複数回の試行や適切な初期化が不可欠です。また、事前にクラスタ数(混合数)を人間が指定する必要があり、最適なクラスタ数を選択するためにはAIC(赤池情報量基準)やBIC(ベイズ情報量基準)などの指標を用いた評価が必要です。さらに、データ数が少ない場合に過学習を起こしやすい性質もあります。

更新日時: 2026年9月3日 21:11