統計的仮説検定とは、データをもとに、ある仮説が正しいと言えるかどうかを確率論的に判断するための統計的手法です。データに現れた差や効果が、単なる偶然によるものなのか、それとも意味のある変化なのかを数学的に評価します。機械学習のモデル評価やA/Bテストなど、データ主導の意思決定において非常に重要な役割を果たします。
統計的仮説検定とは
統計的仮説検定とは、得られたデータに基づいて、立てられた仮説が統計的に正しいと言えるかどうかを確率的な基準を用いて判定する手法です。
詳しく解説
統計的仮説検定では、まず「差がない」「効果がない」とする帰無仮説と、その逆である「差がある」「効果がある」とする対立仮説を立てます。検定では、帰無仮説が正しいと仮定したとき、得られたデータがどれくらい珍しいかを計算します。この確率がp値と呼ばれ、事前設定した有意水準を下回る場合、帰無仮説を棄却し、対立仮説を採択します。これにより、偶然による偏りではなく統計的に意味のある違いであると判断できます。
具体例・使われ方
WebサービスのA/Bテストにおいて、デザインAとデザインBでクリック率に違いがあるかを検証する際に使用されます。また、新しい機械学習モデルの予測精度が、従来のベースラインモデルと比較して本当に向上したのかを科学的に証明する際にも適用されます。
似た用語との違い
統計的仮説検定と推定はどちらも推計統計学の手法ですが、目的が異なります。統計的仮説検定が「仮説が正しいか白黒をつける」ことを目的とするのに対し、推定は「母集団のパラメータが具体的にどの程度の値なのかを予測する」ことを目的とします。
注意点
p値が有意水準未満であっても、それは「差があること」を示すだけであり、その差が実務上で重要であるかを意味するわけではありません。また、サンプルサイズが極端に大きい場合、ごくわずかな微差であってもp値が小さくなり、統計的に有意と判定されやすくなる性質があるため注意が必要です。