データリーケージとは、機械学習モデルの訓練時に本来知り得ないテストデータや未来の情報が学習データに混入してしまう現象です。これにより訓練時の評価は高くなるものの、本番環境の未知のデータに対する予測性能が著しく低下します。モデル評価の信頼性を損なうため、適切なデータ前処理と厳格なデータ分割を行うことが極めて重要です。
データリーケージとは
データリーケージとは、機械学習モデルの構築において、予測時に利用できないはずのデータや未来の情報が誤って訓練データに混入してしまう現象のことです。
詳しく解説
機械学習の目的は、未知のデータに対して正確な予測を行う汎化性能の獲得です。しかし、データ分割を行う前に標準化などのデータ前処理を実行したり、時系列データで未来の情報を過去の訓練データに含めたりすると、モデルは解法をカンニングした状態になります。この状態では交差検証などの評価指標が異常に高くなりますが、実際の運用環境にモデルを投入すると性能が著しく悪化します。防止には、特徴量を作成する手順の厳格化と検証データの独立性確保が不可欠です。
具体例・使われ方
具体例として、顧客の離脱予測モデルを構築する際に、離脱後にしか記録されない手続きログを特徴量として含めてしまうケースが挙げられます。また、画像分類において同一の撮影対象の画像が訓練データとテストデータに跨って混入した場合も、正しく評価できません。医療診断モデルで診断後の処方情報を特徴量に入れてしまう誤りも典型例です。
似た用語との違い
セキュリティ上の情報漏洩が外部へ秘密情報が流出する事故を指すのに対し、機械学習のデータリーケージは学習プロセス内で情報が不適切に交じり合い予測評価が歪む問題を指します。また、モデルが訓練データを暗記しすぎる過学習とは異なり、評価側の情報が訓練側へ不当に流出している点が異なります。
注意点
データリーケージが起きていると、開発段階の交差検証で非常に高い精度が得られるため、一見すると高性能なモデルが完成したかのように誤解しやすい点に注意が必要です。本番環境にデプロイした後に初めて性能低下が発覚するため、特徴量の選定理由を明確にし、テストデータを完全に隔離して処理することが求められます。