ベクトル機械学習自然言語処理

コサイン類似度

こさいんるいじど · Cosine Similarity
4 views

コサイン類似度とは、二つのベクトルが向いている方向の近さを測る指標です。AIや自然言語処理の分野において、単語の意味や文章同士の意味的な近さを数値化し、比較するために広く利用されています。

コサイン類似度とは

コサイン類似度とは、多次元空間における二つのベクトルのなす角の余弦(コサイン)を計算し、その向きの近さを-1から1の範囲で数値化する指標です。

詳しく解説

機械学習や自然言語処理では、言葉や文書を数値のリストであるベクトルに変換して処理します。コサイン類似度では、ベクトルの大きさ(長さ)ではなく方向だけに着目するため、文書の長さが異なっていても内容の傾向が似ていれば高い値を示します。AIにおける埋め込み表現の比較において、最も基本的かつ重要な計算方法の一つです。

具体例・使われ方

例えば、検索エンジンにおいてユーザーの質問文と大量の文書データをそれぞれ埋め込みに変換し、コサイン類似度を計算することで、意味が最も近い文書を効率よく探し出すことができます。

似た用語との違い

ユークリッド距離ベクトル間の「空間的な直線距離」を測るのに対し、コサイン類似度は「ベクトルの向きの角度」を測る点が異なります。そのため、データベクトルの長さのスケールに影響を受けにくいという特徴があります。

注意点

コサイン類似度はベクトルの向きのみを評価するため、ベクトルの絶対的な大きさや出現頻度の違い(重要度の差)を正確に反映できない場合があります。また、多次元データのスパース性によっては直感的な意味合いとズレが生じることにも注意が必要です。

更新日時: 2026年8月30日 06:01