統計量とは、データ全体の特性を数値として要約したもののことです。平均値や分散などが代表的であり、機械学習モデルの訓練やデータの傾向把握に欠かせない基礎的な役割を果たします。
統計量とは
一言でいうと、統計量とは「大量のデータからその特徴を要約して数値化したもの」です。
詳しく解説
統計量は、母集団から抽出された標本の特性を数値で表したものであり、データ分析や機械学習の前処理において中心的な役割を果たします。例えば、データの中心傾向を示す平均値や中央値、データの散らばり具合を示す分散や標準偏差などが挙げられます。AIや機械学習の文脈では、モデルへ入力するデータの特徴量を生成する際や、モデルの性能評価、データの分布を確認する探索的データ分析において、データセットの性質を正しく理解するために統計量が活用されます。
具体例・使われ方
具体的な利用例として、機械学習の前処理における「標準化」があります。データセットの平均値と標準偏差という統計量を計算し、それらを用いて各データの値を平均0、分散1にスケーリングすることで、モデルの学習効率や精度を向上させます。また、異常値検知においても平均からの乖離度を統計量で評価して異常を検出します。
似た用語との違い
母集団全体の特性を表す「母数(パラメータ)」と混同されやすいですが、統計量はあくまで手元にある標本から計算された値である点が異なります。また、AIでよく使われる「特徴量」は機械学習モデルに入力する個々の変数を指すため、データの特徴を要約する統計量とは定義が異なります。
注意点
統計量はデータを要約してわかりやすくする一方で、外れ値の影響を強く受けて全体の傾向を見誤らせるリスクがあります。例えば、平均値は極端な外れ値があると大きく変動するため、データの分布によっては中央値などの他の統計量も併せて確認する注意が必要です。