機械学習自然言語処理

露出バイアス

ロシュツバイアス · Exposure Bias
13 views

露出バイアスとは、機械学習モデルの訓練時と生成時における入力データの分布の違いに起因する偏りのことです。自然言語処理の生成モデルなどで、訓練時には正解データを用いる一方で推論時には自身が過去に生成した出力を用いることで発生します。

露出バイアスとは

一言でいうと露出バイアスとは、AIモデルが訓練データでは正解を見るのに対し、本番の文章生成では自身の過去の出力に依存するため、エラーが連鎖して出力品質が低下する現象のことです。

詳しく解説

露出バイアスは、オートレグレッシブな系列生成モデルにおいて、訓練フェーズと推論フェーズの条件設定の不一致から生じます。訓練時には教師強制という手法が用いられ、正解のコンテキストが常にモデルに与えられます。しかし、実際の推論時には正解データが存在しないため、モデル自身が直前に生成した単語を入力として次の予測を行います。その結果、訓練時には経験しなかった誤りをモデル自身が入力として受け取ることで、予測の誤差が雪だるま式に蓄積し、生成結果が不自然になるという問題が発生します。

具体例・使われ方

例えば、AIによる機械翻訳や文章要約のタスクにおいて、最初の数単語の予測をわずかに誤っただけで、それ以降の文章が完全に的外れな内容に変質してしまうケースが挙げられます。これは、誤った予測結果が次のステップの入力として使われることで、露出バイアスが引き起こされた典型的な例です。

似た用語との違い

データセット自体の偏りを指すデータバイアスとは異なります。データバイアスが収集データの偏りに起因するのに対し、露出バイアスは訓練と推論のプロセス上の不一致に起因する点に違いがあります。

注意点

露出バイアスを完全に回避することは難しく、根本的な解決にはカリキュラム学習や強化学習を用いた最適化など、訓練と推論のギャップを埋めるための高度な学習手法を導入する必要があります。

更新日時: 2026年9月18日 14:15