データドリフトとは、機械学習モデルの訓練時に使用したデータと、本番環境で実際に入力されるデータの分布が時間の経過とともに変化する現象です。モデルの予測精度低下を招く主要因であり、適切なモデル監視と再学習の判断基準として重要視されています。
データドリフトとは
一言でいうとデータドリフトとは、AIモデルの学習時と運用時でデータの性質が変わってしまう現象のことです。
詳しく解説
データドリフトは、現実世界の環境変化やユーザー嗜好の移り変わりによって発生します。例えば、経済状況の変化やシーズンの移行などが背景にあります。機械学習モデルは過去のデータに基づいてパターンを学習するため、入力データの傾向が変わると、学習時の前提が崩れてしまいます。そのため、AI運用(MLOps)の現場では、モデルの性能を維持するためにデータドリフトの検知が極めて重要となります。
具体例・使われ方
ECサイトの推薦システムにおいて、夏のトレンド時期に学習したモデルを冬にそのまま運用し続けた結果、ユーザーの購買行動やトレンドの変化に対応できず、推薦精度が低下するケースが代表的な例です。他にも、金融機関の不正検知モデルにおいて、新たな手口の不正が増加することでデータの傾向が変わり、予測に影響を及ぼす場合があります。
似た用語との違い
概念として混同されやすいものに「コンセプトドリフト」があります。データドリフトが入力データの分布自体の変化を指すのに対し、コンセプトドリフトは「入力データと正解ラベルの関係性」が変化することを指します。例えば、同じデータであっても、社会情勢の変化によって人々の判断基準そのものが変わる場合などがコンセプトドリフトに該当します。
注意点
データドリフトが発生したからといって、直ちにモデルの予測精度が致命的に悪化するとは限りません。過剰に検知して頻繁に再学習を行うと、コストが増大するだけでなく、一時的なノイズにモデルが過剰適応してしまうリスクもあります。したがって、実際のモデル監視においては、予測結果への影響度を慎重に見極める必要があります。