データ前処理機械学習

特徴量スケール

とくちょうりょうすけーる · Feature Scaling
1 views

特徴量スケールとは、機械学習モデルに入力するデータの数値の範囲を揃える前処理手法です。変数ごとの単位や値の大きさが異なる場合に調整を行うことで、勾配降下法の収束速度やアルゴリズムの予測精度を向上させます。

特徴量スケールとは

特徴量スケールを一言でいうと、機械学習モデルの学習効率や精度を高めるために、異なる変数間でデータの大きさを揃える前処理のことです。

詳しく解説

機械学習では、年齢や年収、面積など様々なデータを扱いますが、これらは値の範囲(スケール)がバラバラです。例えば、年収が数百万円で年齢が数十歳の場合、そのままモデルに入力すると値の大きい年収データが過剰に重視されてしまいます。これを防ぐため、特徴量スケールを用いてすべてのデータを一定の範囲に収め、機械学習アルゴリズムが公平に学習できるようにします。特に勾配降下法を用いるアルゴリズムや、k最近傍法のように距離計算を行う手法では必須の処理です。

具体例・使われ方

代表的な手法として、データの最小値を0、最大値を1にする「正規化(Min-Maxスケーリング)」や、平均を0、分散を1にする「標準化」があります。例えば、不動産の予測モデルにおいて、「部屋の広さ(数平方メートル〜数百平方メートル)」と「築年数(0〜50年)」を扱う際、特徴量スケールを適用することで、両方の情報を適切にモデルへ反映させることができます。

似た用語との違い

正規化標準化はどちらも特徴量スケールの代表的な手法ですが、アプローチが異なります。正規化はデータの範囲を固定の上下限(通常は0から1)に収めるのに対し、標準化はデータの分布を平均0、分散1の正規分布に近づけます。目的やデータの性質に応じて使い分けられます。

注意点

特徴量スケールを行う際は、訓練データとテストデータを分けて処理することが重要です。テストデータを含めた全体でスケーリングを行うと、訓練時に未来の情報が漏れ出すデータリークが発生し、未知のデータに対する予測性能が低下する恐れがあります。

更新日時: 2026年8月31日 22:41