距離尺度とは、データ間の類似度や非類似度を数値として定量化するための数学的な基準です。機械学習やデータ分析において、データ同士の近さを測るために不可欠な概念であり、アルゴリズムの性能に大きな影響を与えます。
距離尺度とは
距離尺度とは、二つのデータポイントの間にどれほどの隔たりがあるかを測るための基準です。
詳しく解説
AIや機械学習の分野において、データは多次元空間上の「点」として表現されます。距離尺度は、これらの点と点の間隔を計算するために使われます。例えば、k最近傍法(KNN)やクラスタリング手法では、最も近いデータを見つけるために距離尺度が用いられます。データの性質や次元数に応じて、ユークリッド距離やマンハッタン距離など様々な計算方法が使い分けられます。
具体例・使われ方
顧客の購買履歴や年齢などの特徴量を多次元のデータとして扱い、類似した傾向を持つ顧客グループを分類するクラスタリングに利用されます。また、画像認識や自然言語処理において、画像の特徴ベクトルや単語の埋め込み表現同士の近さを計算する際にも距離尺度が活用されています。
似た用語との違い
類似度との違いとして、距離尺度は値が小さいほどデータ同士が似ている(距離が近い)ことを意味するのに対し、類似度は値が大きいほど似ていることを意味する点が挙げられます。また、コサイン類似度などは向きに着目しますが、通常の距離尺度は絶対的な位置や長さを重視する傾向があります。
注意点
データの次元数が増えると、すべてのデータ間の距離が均等に感じられるようになる「次元の呪い」が発生しやすくなります。また、データの単位やスケールが異なる場合、特定の大きな数値を持つ特徴量に距離の計算が支配されてしまうため、事前に正規化や標準化を行う前処理が重要です。
この解説は役に立ちましたか?誤りが含まれる場合はご報告いただけますと幸いです。
更新日時: 2026年8月31日 07:01