機械学習自然言語処理

単語埋め込み

たんごうめこみ · Word Embedding
5 views

単語埋め込みとは、自然言語処理において単語の意味や文脈上の類似性を高次元のベクトル(数値列)として表現する技術です。単語同士の意味的な関係を数学的に計算可能にし、検索エンジン、機械翻訳、感情分析など多様なAIアプリケーションの基礎として活用されています。

単語埋め込みとは

単語埋め込みとは、自然言語処理において単語を多次元の数値リスト(ベクトル)として表現する技術のことです。言葉の意味や文脈上の類似性を数学的な距離や方向に変換することで、コンピュータがテキストの意味を計算・処理できるようにします。

詳しく解説

従来のワンホットエンコーディングなどの手法では、単語間の意味的な関係性を捉えることが困難でした。単語埋め込みでは、大量のテキストデータを機械学習モデル(代表例としてWord2Vecなど)に学習させ、単語を「分散表現」と呼ばれる数十から数百次元の連続値のベクトルに圧縮・変換します。これにより、「王 - 男 + 女 = 女王」のような単語同士の意味の足し算・引き算が可能になり、類似した意味を持つ単語同士がベクトル空間上で近くに配置されるようになります。現代の大規模言語モデルや各種NLPタスクの基礎技術として非常に重要です。

具体例・使われ方

例えば、検索エンジンでの表記揺れ検索や、ニュース記事の自動分類、機械翻訳などで利用されます。「パソコン」と「PC」が異なる単語であっても、単語埋め込みによって類似したベクトルとして扱われるため、システムは同義語として正しく認識できます。

似た用語との違い

単語埋め込みと文脈依存の文埋め込みの違いとして、伝統的なWord2Vecなどの単語埋め込みは、文脈に関わらず特定の単語に対して常に固定された1つのベクトルを割り当てます。一方、Transformerなどの現代的な手法では、周囲の文脈に応じて同じ単語でも異なるベクトル表現が生成される点が異なります。

注意点

学習データに含まれる偏り(ジェンダーや人種に関するバイアス)がそのままベクトルに反映されてしまうリスクがあります。また、多義語(例えば「ハシ」が橋・箸・端を意味する場合など)を固定のベクトルで表現しようとすると、意味の混同が生じやすいという限界が存在します。

更新日時: 2026年8月28日 20:01