オーバーサンプリングとは、機械学習のデータ前処理手法の一つであり、少数派クラスのデータ数を人工的に増やすことで、データの不均衡を解消しモデルの予測精度を向上させる技術です。
オーバーサンプリングとは
一言でいうと、オーバーサンプリングとは、機械学習におけるデータ不均衡問題を解決するために、数の少ないデータのサンプルを増やしてバランスを取る手法のことです。
詳しく解説
機械学習の分類問題において、例えば正常データが99%で異常データが1%しかないような極端な不均衡データが存在する場合、モデルは多数派である正常を予測するだけで正解率が高くなってしまい、異常を正しく検出できなくなります。この課題に対処するため、オーバーサンプリングを用いて少数派クラスのサンプルを増加させます。代表的な手法として、既存のデータを複製するランダムオーバーサンプリングや、データの隙間を補間して新しいデータを生成するSMOTEなどが広く利用されており、モデルが少数派の特徴を学習しやすくなる重要性があります。
具体例・使われ方
クレジットカードの不正利用検知や医療分野の希少疾患診断などが挙げられます。これらの分野では発生件数が極めて少ないため、SMOTEなどのアルゴリズムを用いて少数派のデータを補い、見逃しを防ぐための訓練データを作成します。
似た用語との違い
データの不均衡を解消する手法としてアンダーサンプリングがありますが、アンダーサンプリングは多数派クラスのデータを削減してバランスを取るのに対し、オーバーサンプリングは少数派クラスのデータを増やす点が異なります。また、データ拡張は主に画像や音声などの非構造化データに対して現実的な多様性を付与する目的で使われることが多く、オーバーサンプリングは主に表形式データの数的な偏りを補正する文脈で使われます。
注意点
オーバーサンプリングの主な注意点として、既存データの複製や単純な補間によって生成されたデータが過学習を引き起こすリスクがあります。特に訓練データに対して無理にバランスを合わせると、未知のテストデータに対する汎用的な予測性能が低下する場合があるため注意が必要です。