アンダーサンプリングとは、機械学習のデータ前処理において、データ数が過剰な多数派クラスのサンプルを削減し、少数派クラスとのバランスを調整する手法です。不均衡データによるモデルの偏りを防ぎ、正しく学習させるために広く利用されています。
アンダーサンプリングとは
一言でいうと、アンダーサンプリングとは、機械学習の学習データにおいて件数が多すぎるクラスのデータを意図的に減らし、クラス間のデータ量の偏りを解消する技術のことです。
詳しく解説
実世界の多くのデータセット、例えばクレジットカードの不正検知や病気の診断などでは、正常データが圧倒的多数を占め、異常データが極端に少なくなります。このような不均衡データをそのまま機械学習モデルに入力すると、多数派クラスばかりを予測する精度の低いモデルになってしまいます。アンダーサンプリングは、多数派クラスから一部のデータをランダムまたは特定の基準に基づいて抽出し、データ量を少数派クラスに合わせることで、モデルが少数派の特徴も学習できるように改善します。
具体例・使われ方
例えば、100万件の正常な取引データと1万件の不正な取引データがある場合、正常データの中からランダムに1万件を抽出し、合計2万件のバランスの取れたデータセットを作成してモデルに学習させます。
似た用語との違い
オーバーサンプリングとは、少数派クラスのデータを複製したり生成したりしてデータ数を増やすアプローチであり、データを減らすアンダーサンプリングとは逆の操作になります。
注意点
アンダーサンプリングの最大の注意点は、多数派クラスの重要な情報や特徴量を持つデータを削除してしまう可能性があることです。これにより、モデル全体の汎用性が低下する場合があるため、必要に応じてオーバーサンプリングや適切な評価指標の選択を組み合わせることが重要です。
この解説は役に立ちましたか?誤りが含まれる場合はご報告いただけますと幸いです。
更新日時: 2026年8月31日 01:41