データ分析機械学習統計学

主成分分析

しゅせいぶんぶんせき · Principal Component Analysis
6 views

主成分分析とは、多次元データの情報を可能な限り失わずに、より少ない変数へと要約する次元削減の手法です。AIや機械学習の前処理として、データの可視化や過学習の防止に広く活用されています。

主成分分析とは

一言でいうと、多くの情報が絡み合う複雑なデータを、データの持つ本質的な特徴を保ったまま要約し、少数の変数に圧縮する統計手法です。

詳しく解説

主成分分析は、多数の変数を持つデータから、お互いに相関のない新しい変数である「主成分」を計算によって作り出す手法です。データのばらつき(分散)が最大になる方向を第一主成分、それに直交しつつ次に分散が大きくなる方向を第二主成分として順番に抽出していきます。機械学習の前処理として次元削減を行うことで、データの可視化が容易になり、計算コストの削減や過学習の抑制につながるため非常に重要です。

具体例・使われ方

例えば、生徒の国語、数学、英語、理科、社会のテストの点数という5つの変数がある場合、これらをそのままでは二次元のグラフで視覚的に表現するのは困難です。主成分分析を適用することで、「文系的な能力を表す主成分」と「理系的な能力を表す主成分」の2つの軸に要約し、散布図として二次元で分かりやすく可視化することができます。

似た用語との違い

混同されやすい概念として線形判別分析がありますが、主成分分析が教師なし学習としてデータの分散を最大化する軸を探すのに対し、線形判別分析は教師あり学習であり、クラス間の違いを最もよく説明する軸を探す点が異なります。

注意点

主成分分析には、データが線形の関係にあることを前提としているため非線形な関係には対応しにくい点や、変数を圧縮する過程で元のデータが持つ情報のの一部が失われるという限界があります。また、抽出された主成分が人間にとって必ずしも解釈しやすい意味を持つとは限らない点にも注意が必要です。

更新日時: 2026年8月27日 12:41