収集したデータセットの一部分において、測定エラーや未入力などの理由により本来あるべき値が存在しない状態のこと。機械学習モデルの訓練や統計解析を行う際、欠損が含まれているとエラーの原因や予測精度の低下に直結するため、データの削除や値の穴埋めを行うデータ前処理を適切に施す必要があります。
欠損とは
欠損とは、データセットを構成するレコードや変数のなかに、本来記録されるべき値が存在せず、空欄やヌル(NullやNaN)になっている状態のことです。
詳しく解説
欠損が発生する背景には、アンケートの未回答、センサーの故障、通信エラー、システムの不整合など様々な原因があります。統計学や機械学習において、欠損は主に「完全にランダムな欠損」「観測値に依存するランダムな欠損」「観測値自体に依存する非ランダムな欠損」の3つのメカニズムに分類されます。これらを無視して解析を行うと、モデルにバイアスが生じたり、学習アルゴリズムが実行できなくなったりするため、データ前処理の段階で適切に処理することが極めて重要です。
具体例・使われ方
例えば、顧客満足度アンケートで「収入」の項目が未記入だった場合や、気象観測データで停電により特定の時間帯の「気温」データが取得できなかった場合が該当します。プログラム上では、欠損は「NaN」や「Null」、「None」などの特殊な表現でデータフレーム上に配置されるのが一般的です。
似た用語との違い
「異常値(外れ値)」は、データ自体は測定されているものの、極端に大きかったり小さかったりする異常な数値を指します。これに対して「欠損」は、値そのものが存在しない状態を指すため異なります。また、意図的に入力されなかった「0」や「空文字」は値として存在しているため、データが欠落している欠損とは明確に区別されます。
注意点
欠損を処理する際、単純に欠損を含む行ごと削除する手法は、データ量が減少してモデルの表現力が下がるリスクがあります。平均値や中央値で埋める「補完手法」を用いる場合も、データの分散が過小評価され、予測モデルの精度を歪めてしまう可能性があるため、欠損が発生した背景やデータの性質を慎重に見極める必要があります。