共変量シフトとは、機械学習モデルの訓練データとテストデータの間で入力データの確率分布が変化する現象のことです。モデルの予測精度低下を招く大きな原因となり、ドメイン適応やモデルの監視において重要な課題とされています。
共変量シフトとは
一言でいうと、共変量シフトとは「訓練時と運用時で入力データの傾向が変わってしまう現象」のことです。
詳しく解説
共変量シフトは、機械学習モデルの構築に使用した訓練データと、実際に運用して予測を行うテストデータの間で、入力特徴量の確率分布が異なる場合に発生します。出力変数に対する入力変数の条件付き確率は変化しないものの、入力変数自体の分布が変わるのが特徴です。例えば、過去のデータで学習した予測モデルに、時間の経過や環境の変化によって異なる傾向を持つ新しいデータを入力すると、予測精度が大幅に低下する原因となります。この現象への対策として、ドメイン適応技術やモデルの定期的な再学習、データの重み付け調整などが広く行われています。
具体例・使われ方
例えば、晴天時の画像データのみを用いて学習した自動運転の画像認識モデルを、雪や雨が降る悪天候の環境下でそのまま使用するケースが挙げられます。入力される画像の画風や色合いが大きく変わるため、正しく物体を検出できなくなるリスクが生じます。
似た用語との違い
概念として混同されやすいものに概念シフトがあります。概念シフトは入力データの分布が変わらなくても出力の正解定義そのものが変わる現象を指しますが、共変量シフトは入力の分布だけが変化し出力の関係性は保たれるという点に違いがあります。
注意点
共変量シフトが発生していても、機械学習モデルの出力結果や単体の精度評価だけでは気付きにくい場合があります。そのため、運用環境におけるデータの分布変化を常時監視する仕組みを導入することが重要です。
この解説は役に立ちましたか?誤りが含まれる場合はご報告いただけますと幸いです。
更新日時: 2026年9月3日 13:51