人間フィードバックによる強化学習(RLHF)とは、人間の評価データを活用してAIモデルの出力精度や安全性を高める機械学習の手法です。大規模言語モデルなどの出力に対して人間が良し悪しを評価し、その基準に基づいて報酬モデルを学習させ、AIを調整します。AIの意図しない挙動や不適切な発言を抑え、人間の価値観に合わせた出力(アライメント)を実現する重要な技術です。
人間フィードバックによる強化学習とは
人間フィードバックによる強化学習とは、AIが生成した回答に対して人間が評価を行い、その評価基準をもとにAIの振る舞いを人間の望む方向へ最適化する技術です。
詳しく解説
従来の機械学習では、あらかじめ用意された正解データとの誤差を最小化するようにモデルを学習させていました。しかし、対話型AIなどの生成物には明確な単一の「正解」が存在しないことが多く、明示的なルール記述だけでは適切な応答を定義しきれない課題がありました。そこで登場したのが本手法です。一般的なプロセスでは、まず事後学習として教師あり微調整を行い、次にモデルが出力した複数の回答案を人間がランク付けして評価データを作成します。この評価データから人間の選好を予測する「報酬モデル」を構築し、その報酬を最大化するように強化学習アルゴリズムを用いてAIのパラメータを更新します。これにより、AIの出力が人間の意図や倫理観に沿うように調整する「アライメント」が可能となります。
具体例・使われ方
対話型AIアシスタントの調整において、有害な発言の抑制やユーザーの指示に対する丁寧な回答の生成に用いられます。例えば、AIが不適切な質問に対して回答を拒否したり、より安全で有益な情報を提案したりできるようになります。
似た用語との違い
「教師あり微調整」が人間が作成した理想的な対話例をそのまま真似させる手法であるのに対し、人間フィードバックによる強化学習は人間による相対的な比較・評価をもとにAI自らが試行錯誤して回答品質を高める手法です。また、従来の「強化学習」がゲームのスコアのように明確に定義された環境報酬を用いるのに対し、本手法では人間による定性的な評価に基づいて動的に作成された「報酬モデル」のシグナルを用いる点も異なります。
注意点
人間の評価者によるバイアスや主観がAIの出力傾向に反映されるリスクがあります。また、人間が好ましいと感じる回答が必ずしも客観的な事実や正確性を保証するわけではない点に注意が必要です。AIが報酬モデルを騙して見かけ上の評価だけを高くしようとする現象への対策も必要となります。