データ分析機械学習

不均衡データ

ふきんこうでーた · Imbalanced Data
2 views

不均衡データとは、機械学習の分類問題において、特定のクラスに属するデータ数が他のクラスに比べて極端に少ない状態を指します。そのままでは多数派の予測ばかりを学習してしまうため、適切な前処理やモデルの調整が必要です。

不均衡データとは

一言でいうと不均衡データとは、機械学習の訓練用データにおいて、各クラスのサンプル数に大きな偏りがある状態のことです。

詳しく解説

機械学習モデルを構築する際、例えば正常な取引データが99件で不正な取引データが1件といった不均衡データを用いると、モデルは「すべて正常である」と予測するだけで99%の正解率を出せてしまいます。この背景には、多くのアルゴリズムが全体の正解率を最大化するように最適化される仕組みがあるためです。結果として、本当に検知したい少数派のパターンを学習できず、実用上役に立たないモデルになってしまうという重要な課題が生じます。

具体例・使われ方

具体的な利用例としては、クレジットカードの不正利用検知、製造ラインにおける製品の不良品検出、あるいはごく稀にしか発生しない重篤な病気の診断などが挙げられます。これらの場面では、検知対象となるインシデントや異常値が少数派の不均衡データとして現れます。

似た用語との違い

一般的な分類問題で使われる「バランスの取れたデータ」とは異なり、不均衡データはクラス間の比率が極端に偏っている点が特徴です。特段、回帰問題におけるデータの偏りと混同されやすいですが、不均衡データは主に離散的なクラス分類におけるサンプル数の偏りを指します。

注意点

不均衡データを扱う際の注意点として、単に正解率(Accuracy)だけを評価指標にするとモデルの性能を誤認することが挙げられます。代わりに、適合率や再現率、F1スコア、あるいはROC-AUCなどの指標を用いることが重要です。また、過剰サンプリングや過小サンプリングなどの手法を適用する際にも、過学習を引き起こさないよう慎重な検証が求められます。

更新日時: 2026年8月29日 05:21