ベクトル機械学習自然言語処理

分散表現

ぶんさんひょうげん · Distributed Representation
4 views

分散表現とは、単語や概念を多次元の連続値ベクトルとして表現する自然言語処理の技術です。意味の似た言葉同士が近傍に配置されるため、コンピュータが意味の類似性を数値として捉えることが可能になり、現代のAIの基礎技術となっています。

分散表現とは

一言でいうと、言葉の意味を数字の並び(ベクトル)に変換し、コンピュータが「意味」を理解できるようにする仕組みです。

詳しく解説

分散表現は、単語を一つの独立したIDとして扱うのではなく、意味の要素を複数の次元に分散させて表現します。例えば、王様や女王、男性や女性といった概念を数百次元の連続値で表すことで、意味の近さや関係性を計算できるようになります。背景にはニューラルネットワークを用いた学習手法があり、膨大なテキストデータから単語同士の文脈的な共起関係を自動的に学習して獲得されます。これにより、単語の同義語判定や文脈理解の精度が飛躍的に向上しました。

具体例・使われ方

例えば、「リンゴ」と「みかん」という単語は、どちらも果物であるという共通の文脈で使われることが多いため、分散表現の空間内では互いに近い座標に配置されます。また、「王様 - 男性 + 女性 = 女王」のような単語の足し算や引き算といった意味の演算が可能になることも、具体的な利用例として挙げられます。

似た用語との違い

従来の局所表現(ワンホットエンコーディング)とは異なり、分散表現では単語同士の関係性や類似性をベクトル間の距離として測定できる点が大きく異なります。局所表現では単語間の意味的つながりが全く考慮されませんが、分散表現では高次元空間における位置関係として意味が保持されます。

注意点

分散表現には、文脈によって意味が異なる多義語を一つのベクトルで完全に表現しきれないという限界があります。また、学習に使用するテキストデータに含まれる社会的バイアスや偏見をそのまま学習してしまい、AIの出力に反映されてしまう点にも注意が必要です。

更新日時: 2026年8月30日 06:11