ベイズ推論は、新たに観測されたデータに基づいて、ある事象の発生確率(事後確率)を順次更新していく統計的な手法です。不確実性を確率分布として扱えるため、機械学習の予測や意思決定において重要な役割を果たします。
ベイズ推論とは
ベイズ推論とは、得られた観測データをもとに、ある前提や仮説が正しいとされる確率(尤もらしさ)を逐次的に更新していく、確率・統計学に基づいた推論アルゴリズムです。
詳しく解説
ベイズ推論は、確率論における「ベイズの定理」を基礎としています。推論を開始する前にある事象が起こる確率を「事前確率」として設定し、新たに得られたデータ(尤度)を掛け合わせることで、データ観測後の確率である「事後確率」を計算します。機械学習の文脈においては、モデルのパラメータを単一の固定値ではなく確率分布として表現するため、データが少ない状態での過学習を防いだり、予測の不確実性を定量的に評価したりする際に極めて有効なアプローチとして活用されています。
具体例・使われ方
具体的な例として、受信したメールの文面から特定の単語が含まれる割合を基に迷惑メールかどうかを判定するスパムフィルターがあります。他にも、自動運転車が各種センサーから得られるノイズ交じりのデータから自車の正確な位置を推定する技術や、医療検査の結果を受けて特定の病気に罹患している確率を診断するシステムなどで広く用いられています。
似た用語との違い
従来の統計学で主流とされる「頻度主義」との違いが代表的です。頻度主義では「真のパラメータは不変の1つの値であり、確率は無限に試行を繰り返したときの発生頻度である」と定義します。これに対してベイズ推論では「パラメータ自体が不確実性を含んだ確率変数である」とみなし、新しいデータが得られるたびにその確率分布を更新・修正していくという柔軟なアプローチをとります。
注意点
主な注意点として、分析者の主観や限られた経験則に基づいて事前確率を設定する必要があるため、客観性に欠けるという批判を受けることがあります。また、複雑な機械学習モデルで事後確率を厳密に計算しようとすると、膨大な計算コストが発生するため、近似計算やサンプリング手法が必要不可欠となる点が挙げられます。