潜在変数とは、データから直接観測することはできないものの、背後にある本質的な構造やメカニズムを説明するために仮定される変数です。機械学習や統計学において、複雑なデータの背後にある要因を見つけ出すために広く利用されています。
潜在変数とは
一言でいうと、直接は見えないけれどもデータの背後に存在して全体に影響を与えている隠れた因子のことです。
詳しく解説
現実世界で観測されるデータは、多くの場合、複雑な要因が絡み合っています。例えば、画像に写る人の「笑顔の度合い」「向き」「照明の明るさ」などは、ピクセル値として直接観測できるデータから逆算されるべき背後の要素です。潜在変数は、このような観測不可能な要因を数式としてモデル化するために導入されます。機械学習においては、オートエンコーダーや変分オートエンコーダーなどの生成モデルにおいて、データを圧縮した特徴表現として潜在変数が学習されます。
具体例・使われ方
例えば、顧客の購買履歴データから「年齢層」「ライフスタイル」「価格重視度」といった直接観測できない潜在変数を推論することで、顧客の好みに合わせた精度の高いレコメンデーションを実現できます。また、テキストデータのトピックモデルにおいては、文書の中に現れる単語の傾向から「どの話題について書かれているか」という潜在変数を抽出します。
似た用語との違い
直接観測できる「観測変数」とは異なり、データそのものとしては記録されていない点が最大の違いです。また、特徴量エンジニアリングで人間が手動で定義する入力特徴量とは異なり、潜在変数は多くの場合、アルゴリズムがデータから自動的に学習・推定するものであるという違いがあります。
注意点
潜在変数はあくまで数学的な仮定やアルゴリズムによる推定結果であるため、現実の物理的実体と必ずしも一致するとは限りません。また、モデルの設計によっては適切な潜在変数が学習されず、過学習を引き起こすリスクがあるため注意が必要です。