説明変数とは、統計学や機械学習において、予測や分析の対象となる結果(目的変数)に影響を与える「要因」となる変数のことです。機械学習では「特徴量」とも呼ばれ、予測モデルの入力データとして使用されます。例えば、住宅価格の予測における「築年数」や「広さ」がこれに該当し、モデルの予測精度を大きく左右する重要な要素です。
説明変数とは
説明変数とは、統計学や機械学習において、予測や分析の対象となる「結果」に対して、その原因や影響を与える側の「要因」となる変数のことです。予測モデルを構築する際の入力データとして機能します。
詳しく解説
統計学や機械学習の文脈において、データから何かを予測・説明しようとする際、数式やモデルが用いられます。このとき、予測される側の変数(結果)を「目的変数」と呼ぶのに対し、予測の根拠や要因となる変数(原因)を説明変数と呼びます。例えば、住宅の価格を予測したい場合、住宅の広さ、築年数、駅からの距離などが説明変数となります。機械学習の分野では、説明変数は「特徴量」とも呼ばれ、モデルの予測精度を大きく左右する極めて重要な要素です。適切な説明変数を構築・選択するプロセスは、優れた予測モデルを構築する上で不可欠です。
具体例・使われ方
説明変数の具体的な例として、以下のようなものがあります。売上予測:過去の広告費、店舗の面積、周辺の人口(これらが説明変数となり、売上高という目的変数を予測します)。不動産価格予測:部屋の広さ、築年数、最寄り駅からの徒歩分数。病気の発症リスク予測:年齢、血圧、1日の平均睡眠時間。これらの要因(説明変数)を重回帰分析などの手法に入力することで、結果を推測します。
似た用語との違い
「説明変数」と混同されやすい概念に「目的変数」があります。説明変数は「予測の手がかりとなる要因(原因)」であるのに対し、目的変数は「予測したい対象(結果)」です。また、機械学習の文脈における「特徴量」は、統計学における説明変数とほぼ同じ意味で使われます。統計学ではモデルの因果関係や説明性に重きを置く一方、機械学習では予測精度を重視して特徴量という呼称が好まれる傾向にあります。
注意点
説明変数を選定する際の注意点として、目的変数と強い相関関係があっても、必ずしも直接的な因果関係があるとは限らない点が挙げられます(擬似相関)。また、説明変数同士に強い相関がある「多重共線性」が発生すると、モデルの解釈が不安定になるため注意が必要です。さらに、不要な説明変数を多く含めすぎると、学習データに過剰に適合してしまう過学習の原因にもなります。