特徴ベクトルとは、画像やテキストなどのデータをAIが処理しやすいように数値の配列に変換したものです。データの持つ性質や特徴を多次元空間上の位置として表現し、機械学習モデルがデータの分類、類似度計算、予測などを行うための基礎となります。AIモデルが多様な情報を数学的に処理するために欠かせない核となる概念です。
特徴ベクトルとは
特徴ベクトルとは、画像、テキスト、音声、顧客データなどの多様な情報を、その特徴や性質を表す数値の集まり(配列)に変換したものです。
詳しく解説
AIや機械学習モデルは、生のテキストや画像をそのまま理解することはできません。そのため、データをいくつかの特徴的な数値(次元)に変換して扱います。例えば、ある人物を「身長、体重、年齢」という3つの数値で表した場合、それは3次元の特徴ベクトルとなります。ディープラーニングなどの高度なモデルでは、数百から数千次元にも及ぶ高次元の特徴ベクトルが生成されます。これにより、データの持つ潜在的な意味やパターンを数学的に表現し、機械学習の分類や回帰、クラスタリングなどのタスクを可能にします。
具体例・使われ方
例えば、画像認識において、1枚の画像を「色の分布」「エッジのパターン」「輝度」などの特徴ベクトルに変換します。また、自然言語処理においては、単語や文章の意味を数値化したワードエンベディングが特徴ベクトルにあたります。これにより、意味空間におけるベクトルの演算や、似たような意味を持つ文章の検索が可能になります。
似た用語との違い
特徴ベクトルと混同されやすい概念に特徴量があります。特徴量は個々のデータの属性や変数のことを指すのに対し、特徴ベクトルはそれら複数の特徴量を一列に並べて配列にしたものを指します。また、ニューラルネットワークの中間層で抽出される埋め込みベクトルは、高次元のデータから抽出された特殊な特徴ベクトルの一種と言えます。
注意点
特徴ベクトルの次元数が多すぎると、次元の呪いと呼ばれる現象が発生し、モデルの学習効率や精度が低下することがあります。また、人間が設計した特徴量を用いる場合、どの特徴を採用するかという選定作業に専門知識と多大な労力が必要です。ディープラーニングではこのプロセスが自動化されましたが、今度は特徴ベクトルがどのような基準で生成されたのかというブラックボックス問題が生じる点に注意が必要です。