多重検定問題とは、統計学的仮説検定を多数回繰り返すことで、本来は偶然であるはずの現象を誤って有意と判定してしまう確率が高まる現象です。AI開発における特徴量選択やA/Bテストなどで頻発し、偽陽性を防ぐための補正が必要となります。
多重検定問題とは
多重検定問題とは、ひとつのデータセットに対して多くの統計的検定を同時にまたは繰り返し行うことにより、偶然による誤った発見(偽陽性)が意図せず増加してしまう現象のことです。
詳しく解説
統計的な仮説検定では、通常「有意水準(アルファ値)」を5%などに設定し、偶然起きる確率が5%未満の事象が起きたときに帰無仮説を棄却します。しかし、何回も検定を繰り返すと、どこかの検定で偶然5%の確率が的中し、実際には効果がないにもかかわらず「効果がある」と誤認してしまう確率が累積して高くなります。機械学習のモデル構築において、大量の候補から有効な特徴量を選び出したり、多数のハイパーパラメータを総当たりで検証したりする際にもこの問題が顕在化します。
具体例・使われ方
AIモデルの性能向上のため、100個の異なる特徴量を個別に統計的検定で評価し、p値が0.05未満のものだけを採用するケース。この場合、実際には目的変数と無関係な特徴量であっても、100個も試せば確率的に数個は偶然有意な結果を示してしまい、モデルに誤って組み込まれる原因になります。
似た用語との違い
単一の仮説検定では設定した有意水準通りの誤り率に抑えられますが、多重検定問題では検定回数が増えるにつれて全体の誤り率が跳ね上がる点が異なります。
注意点
特徴量選択やハイパーパラメータ探索を無計画に繰り返すと、学習データに対して過剰に適合した偽の最適解を選んでしまい、未知のテストデータに対する汎化性能が著しく低下するため注意が必要です。これを防ぐためにはボンフェローニ補正などの多重比較補正を行うことが重要です。