強化学習機械学習

方策勾配法

ほうさくこうばいほう · Policy Gradient Method
23 views

方策勾配法とは、強化学習においてエージェントの行動決定基準である「方策」を直接パラメータ化し、得られる報酬の期待値を最大化するように最適化する手法です。価値関数を経由せずに連続的な行動空間に対応できるため、ロボット制御やゲームAIなどの複雑なタスクで広く活用されています。

方策勾配法とは

方策勾配法とは、強化学習においてエージェントがどのような行動をとるかというルール(方策)をパラメータ化し、より多くの報酬を得られる方向へ直接パラメータを更新していくアルゴリズムです。

詳しく解説

従来の強化学習では、状態や行動の価値を評価する価値関数を学習し、その価値が最も高い行動を選択するアプローチ(価値ベース手法)が一般的でした。しかし、この方法では選択肢が無限にある連続的な行動空間を扱うのが困難でした。これに対し方策勾配法は、行動の確率分布などを出力する「方策」をニューラルネットワークなどで直接表現します。試行錯誤を通じて得られた報酬をもとに「期待報酬の勾配」を計算し、確率パラメータを勾配上昇法で更新します。これにより、多次元かつ連続的な動作の学習が可能となり、確率的な行動選択もスムーズに表現できるようになりました。

具体例・使われ方

例えば、二足歩行ロボットの関節の角度や出力を連続的に制御するタスクにおいて、適切な力の加え方を学習するケースで利用されます。また、囲碁や将棋などのゲームAIにおける行動選択の学習や、大型言語モデルの対話品質を調整するRLHF(人間からのフィードバックによる強化学習)の最適化プロセスなどでも応用されています。

似た用語との違い

価値ベースの手法であるQ学習との主な違いは、学習する対象と行動空間の対応能力です。Q学習は「ある状態で特定の行動をとったときの価値」を学習し、価値が最大となる行動を選びます。そのため離散的な行動選択に向いています。一方、方策勾配法は行動を選ぶ確率(方策)を直接更新するため、ロボットの微調整のような連続的な行動を直接扱うことができます。ただし、Q学習と方策勾配法を組み合わせたアクター・クリティック法というハイブリッドな手法も存在します。

注意点

方策勾配法は、パラメータの更新に用いられる勾配の分散が大きくなりやすく、学習が不安定になりやすいという欠点があります。また、サンプル効率が低く、最適な方策を得るまでに膨大な試行回数(データ)が必要になることが多いです。さらに、局所最適解に陥るリスクもあるため、学習率の設定やクリッピング技術などの工夫が必要となります。

更新日時: 2026年9月7日 08:31