ベイズの定理とは、ある事実を観測した後に、その前提となる原因の確率(事後確率)を更新するための確率論の基本定理です。不確実な状況下で、新しいデータ(尤度)を取り入れて予測を精度良く更新できる特徴があり、機械学習のスパム判定や医療診断など、現代のデータ分析やAI技術の根幹を支えています。
ベイズの定理とは
ベイズの定理とは、ある出来事が観測されたという条件のもとで、その原因となった事象が起こる確率(事後確率)を求めるための確率論の定理です。
詳しく解説
ベイズの定理は、新たな情報やデータが得られるたびに、ある仮説に対する信頼度(確率)を更新していくベイズ統計学の基礎となっています。基本的な数式は、事後確率 = (尤度 × 事前確率) ÷ 全確率 で表されます。ここでいう事前確率はデータを観測する前の予測確率であり、尤度は仮説が正しいとした場合にそのデータが観察される確率、事後確率はデータを得た後の修正された確率を指します。機械学習においては、この定理を応用して不確実性を伴う状況下での意思決定や予測モデルの構築に広く利用されています。
具体例・使われ方
身近な例として、スパムメールの自動フィルタリング(ナイーブベイズ分類器)が挙げられます。メール内に「無料」や「当選」といった特定の単語が含まれているという観測データをもとに、そのメールがスパムである確率(事後確率)を計算し分類します。また、医療診断において、検査が陽性だった場合に本当にその病気に罹患している確率を事前確率と検査の精度から算出する際にも使われます。
似た用語との違い
ベイズの定理に基づくベイズ統計学と、一般的な頻度論的統計学との最大の違いは、確率の捉え方です。頻度論的統計学では確率は「何度も繰り返した際の長期的な発生割合」という客観的な固定値とみなされます。一方、ベイズ統計学では確率は「主観的な確信の度合い」であり、新しいデータ(尤度)が得られるたびに確率を更新していく柔軟性を持っています。
注意点
ベイズの定理を実務で適用する際の大きな課題は、適切な事前確率の設定です。事前確率の選択に主観が入りすぎることで、解析結果が偏るリスクがあります。また、事後確率の計算において複雑な多次元の積分が必要になることが多く、コンピュータの計算負荷が高くなるため、近似アルゴリズムやシミュレーション手法の併用が不可欠となります。