条件付き独立性とは、ある第3の変数が与えられた条件のもとで、2つの確率変数が互いに無関係になる性質です。確率的グラフィカルモデルやベイジアンネットワークにおいて、複雑な確率分布の計算を大幅に簡略化するための重要な基礎概念として利用されています。
条件付き独立性とは
ある共通の条件(第3の変数)の情報を得たことで、それまで存在していた2つの変数の間の関連性が消え、互いに無関係(独立)になる状態のことです。
詳しく解説
確率論や機械学習において、2つの確率変数AとBが、変数Cの情報が与えられたときに独立になることを指します。機械学習では、確率的グラフィカルモデルやベイジアンネットワークにおいて複雑な依存関係を整理する基盤となります。条件付き独立性を利用することで、巨大な結合確率分布の計算を局所的な確率の積に分解でき、推論や学習の計算コストを大幅に削減できます。例えばナイーブベイズ分類器では、クラスラベルが与えられたもとで各特徴量が条件付き独立であると仮定して計算を簡略化しています。
具体例・使われ方
例えば「アイスクリームの売り上げ」と「熱中症患者数」は正の相関を示しますが、これは「気温」という共通の原因が存在するためです。ここで気温の値を固定して条件付けると、両者の直接的な関連性は消失し、条件付き独立になります。AIの分野では、ナイーブベイズを用いたスパムメール判定などで、メールがスパムか否かという条件のもとで出現単語同士が条件付き独立であると仮定して確率計算を行います。
似た用語との違い
通常の「独立性(相互独立性)」は、特定の条件がなくても2つの変数が完全に無関係であることを指します。これに対し「条件付き独立性」は、第3の変数の情報を条件として与えることで初めて独立になる性質です。前者は前提条件を必要としない独立性であり、後者は特定の情報が与えられた文脈においてのみ成立する独立性である点が異なります。
注意点
現実の複雑なデータにおいて完全な条件付き独立性が成立することは稀です。ナイーブベイズのように強い条件付き独立性を仮定する手法では、計算が高速になるメリットがある反面、特徴量間の重要な相互作用を見落とす危険性があります。また、統計的な条件付き独立性が観察されたとしても、それだけで変数間の因果関係を断定することはできません。