前処理機械学習

標準化

ひょうじゅんか · Standardization
2 views

AIや機械学習において、データの平均を0、分散を1にするなど、異なるスケールの特徴量を揃える前処理手法。モデルの学習効率や精度を向上させるために広く用いられます。

標準化とは

一言でいうと、AIモデルの学習効率と精度を高めるために、異なる範囲や単位を持つデータを一定の基準に合わせて整える前処理のことです。

詳しく解説

機械学習で扱うデータには、年齢(0〜100など)や収入(数百万円単位)のように、特徴量ごとに数値のスケールが大きく異なる場合があります。そのまま学習を行うと、スケールの大きい特徴量が過剰に影響を与え、モデルが不安定になる問題が発生します。そこで、データの平均値を0に、分散を1に変換する標準化を行うことで、すべての特徴量を同じ土俵で公平に評価できるようにします。これにより、勾配降下法などの最適化アルゴリズムが効率的に動作し、学習スピードや精度が向上します。

具体例・使われ方

顧客データの分析において、年齢と年収という単位の異なる数値を同時に機械学習モデルに入力する際、標準化を適用してそれぞれの平均と分散を揃えます。これにより、モデルが特定の変数に偏ることなく、正確に予測や分類を行えるようになります。

似た用語との違い

データを0から1の範囲に収まるように変換する「正規化」と混同されやすいです。正規化は最小値と最大値を基準にするのに対し、標準化は平均と分散を基準にする点が異なります。

注意点

データに極端な外れ値が含まれている場合、標準化を行うことで平均値や分散が大きく歪み、適切な前処理ができなくなる点に注意が必要です。また、過学習を防ぐために、テストデータではなく訓練データの平均と分散を使って変換を行う必要があります。

更新日時: 2026年8月29日 11:31