データ前処理機械学習

単一代入法

たんだいにゅうほう · Single Imputation
1 views

単一代入法とは、データセット内の欠損値に対して、平均値や中央値、予測値などの単一の値を1回だけ代入して補完するデータ前処理の手法です。シンプルで計算コストが低い一方、データのばらつきや不確実性を過小評価しやすい欠点があります。機械学習モデルの訓練データ作成や統計分析の初期段階でよく用いられます。

単一代入法とは

単一代入法は、データセットに含まれる欠損値に対して、特定の方法で算出された単一の代表値を一度だけ代入して埋めるデータ前処理の手法です。

詳しく解説

データ分析や機械学習において、入力データに欠損値が含まれていると、多くのアルゴリズムが正常に動作しないか、予測精度が低下します。この問題を解決する最も簡単なアプローチが単一代入法です。具体的な仕組みとして、欠損している箇所に、その変数の平均値、中央値、最頻値などの統計量をそのまま当てはめる方法(平均値代入法など)や、他の変数から回帰分析などを用いて予測した値を代入する予測値代入法などがあります。この手法は実装が極めて容易で計算負荷が低いという背景から、データのクリーニング段階で広く重宝されています。しかし、欠損値を1つの確定した値として扱うため、データ全体の分散(ばらつき)が実際よりも小さくなり、統計的な仮説検定において有意差が出やすくなるなどの偏り(バイアス)が生じるリスクがあります。

具体例・使われ方

例えば、あるアンケート調査で一部の回答者が年収を無回答(欠損)にしていたとします。単一代入法を用いる場合、無回答以外の全員の平均年収(例:500万円)を算出し、未回答者全員のデータに一律で500万円を代入します。また、機械学習の分類タスクにおいて、顧客の年齢データに一部欠損がある場合、中央値で一括補完して機械学習モデルの入力データとするケースが挙げられます。このように、欠損値を速やかに埋めて分析可能な状態にする際に用いられます。

似た用語との違い

単一代入法とよく対比されるのが多重代入法です。多重代入法は、欠損値に対して複数の異なる予測値を代入したデータセットを複数作成し、それぞれを分析した後に結果を統合する手法です。単一代入法が欠損値に1つの値を代入して不確実性を無視するのに対し、多重代入法は代入値自体のばらつき(不確実性)を考慮して統計的推測を行うという違いがあります。また、欠損値を単に削除するリストワイズ削除とも異なります。リストワイズ削除はデータ全体のサンプルサイズを減らしてしまいますが、単一代入法はサンプル数を維持できるメリットがあります。

注意点

最大の注意点は、単一代入法によって補完されたデータは、真の値ではないという点です。特に平均値代入法などを行うと、データの標準偏差が不自然に小さくなり、相関係数や回帰係数に歪み(バイアス)が生じます。これにより、誤った統計的判断を下す危険性があります。また、欠損が完全にランダムに発生しているという仮定が成り立たない場合、代入されたデータは著しく偏ったものになります。予測精度が最優先される機械学習では有効な場合もありますが、厳密な因果関係や仮説検定を目的とする統計分析では、使用に慎重な判断が求められます。

更新日時: 2026年9月1日 21:51