露光バイアスとは、AIの系列生成タスクにおいて、訓練時と推論時のデータ分布の乖離によって生じる予測精度の低下現象です。訓練時は常に正しい先行トークンが与えられますが、推論時には自ら生成した誤りを含む可能性のあるトークンを入力とするため、誤差が雪だるま式に蓄積します。主に自然言語処理や音声合成などで問題となります。
露光バイアスとは
露光バイアスとは、主に自然言語処理などの系列生成AIにおいて、訓練時と推論時に入力されるデータの性質が異なる(訓練時は常に正解、推論時は自作の予測値)ことによって、一度の誤りが引き金となって以降の生成品質が急速に悪化していく現象です。
詳しく解説
露光バイアスは、自回帰モデル(特にTransformerやRNNを用いたデコーダ)の学習で広く用いられる「教師強制」という手法に起因します。教師強制では、モデルが学習中に過去の予測を間違えても、次のステップの入力には常に正しい正解データ(グラウンドトゥルース)が与えられます。しかし、実際の推論時には正解データが存在しないため、直前に自分自身が出力した予測トークンを次のステップの入力として使用します。この訓練と推論の乖離(ミスマッチ)により、推論時にモデルが一度でも不自然な出力を生成すると、訓練時には「露光(経験)」したことのない未知の文脈データに直面することになり、そこから生じる累積誤差が後続の生成に連鎖し、出力全体の品質が著しく劣化します。
具体例・使われ方
例えば、機械翻訳やテキスト要約のタスクにおいて、AIが冒頭の数語をわずかに誤って訳したとします。自回帰モデルは直前の誤った単語を「正しい前提」として次の単語を予測するため、文が進むにつれて意味が破綻したり、同じフレーズを何度も繰り返すループ状態に陥ったりします。このような系列生成における累積誤差の拡大が、露光バイアスによる具体的な悪影響のイメージです。
似た用語との違い
「教師強制」は、学習を効率化・安定化させるための「手法(訓練アルゴリズム)」そのものを指します。これに対して「露光バイアス」は、教師強制を採用した結果として訓練時と推論時の入力分布に乖離が生じ、推論時の生成精度が低下する「課題(現象)」を指します。また、過学習は訓練データに適合しすぎて汎化性能が落ちる一般的な現象ですが、露光バイアスは時系列や系列データ生成に特有の構造的な不一致に起因する問題であるという点で異なります。
注意点
露光バイアスへの対策として、訓練中に徐々に正解データからモデル自身の予測値に入力を切り替えるスケジュールサンプリングなどの手法が開発されていますが、これらは訓練コストの増加や学習の不安定化を伴う場合があります。また、大規模言語モデル(LLM)では大量のデータによる事前学習や強化学習(RLHF)などによってある程度緩和されますが、原理的に完全に解決されたわけではなく、長文生成における品質低下の主要な要因として依然として注意が必要です。