情報理論数学機械学習

クルバック・ライブラー情報量

くるばっくらいぶらーじほうりょう · Kullback-Leibler Divergence
16 views

クルバック・ライブラー情報量とは、2つの確率分布の間にどれほどの違いがあるかを測定するための指標です。機械学習や深層学習において、モデルが予測した確率分布と実際の正解データが持つ確率分布の差を評価する際によく利用されます。

クルバック・ライブラー情報量とは

一言でいうと、クルバック・ライブラー情報量は「ある確率分布が、もう一つの確率分布からどれだけ乖離しているか」を表す指標です。

詳しく解説

情報理論において、真の確率分布Pに対して、近似的な確率分布Qを用いた際に発生する情報量の損失を数値化したものです。機械学習の分野では、教師あり学習の損失関数として用いられる交差エントロピーの計算や、生成モデルの学習過程において頻繁に登場します。特に、変分オートエンコーダーでは潜在空間の正則化に利用されるなど、複雑な確率分布を扱う際に重要な役割を果たします。

具体例・使われ方

例えば、画像認識AIにおいて「犬である確率が70%、猫である確率が30%」と予測したモデルの確率分布と、実際の正解ラベルが「犬である確率が100%」である確率分布との間のズレを数値化する際に使われます。

似た用語との違い

平均二乗誤差などの通常の距離指標とは異なり、クルバック・ライブラー情報量は対称ではありません。つまり、Pから見たQの乖離度と、Qから見たPの乖離度は一般に一致しないという特徴があります。

注意点

対称性がないため、数学的な意味での「距離」としては扱えません。また、一方の確率分布の確率がゼロである領域において、もう一方の確率分布がゼロでない場合、計算が破綻したり無限大になったりする点に注意が必要です。

更新日時: 2026年9月16日 01:31