強化学習機械学習

即時報酬

そくじほうしゅう · Immediate Reward
1 views

強化学習において、エージェントが特定の状態からある行動を選択した直後に、環境から即座に与えられるフィードバック(報酬)のことです。エージェントの行動選択がどれほど適切だったかを局所的に評価する指標であり、長期的視点を考慮した累積報酬を最大化するための基礎的な構成要素として機能します。

即時報酬とは

即時報酬とは、強化学習の枠組みにおいて、意思決定を行う主体であるエージェントが、ある状態で特定の行動をとった直後のステップで環境から直接的に受け取る報酬(数値的な評価値)のことです。

詳しく解説

強化学習では、エージェント環境と相互作用しながら、得られる報酬の総和を最大化するように学習を進めます。このとき、行動の直後に得られる評価が即時報酬です。即時報酬は現在の行動に対する直接的な良し悪しを伝えますが、これだけを基準に行動を選択すると、目先の利益に囚われてしまい、将来的に得られる大きな利益を逃す可能性があります。そのため、強化学習のアルゴリズムでは、即時報酬と将来得られる予測報酬に対して割引率を適用し、それらを足し合わせた累積報酬(または価値関数)を最大化するように方策を更新します。

具体例・使われ方

例えば、自動運転車の制御タスクにおいて、車線中央を維持して走行できた瞬間に与えられるプラスのポイントや、障害物に衝突した直後に与えられるペナルティ(マイナスのポイント)が即時報酬に該当します。また、囲碁や将棋などのゲームAIにおいて、相手の駒を取った瞬間に得られる点数も即時報酬のわかりやすい例です。

似た用語との違い

即時報酬が行動の直後に得られる1ステップ分の評価であるのに対し、累積報酬は将来にわたって得られる報酬の合計値(割引率を適用した将来価値を含む)を指します。また、ゲームの勝敗のように一連の行動の末にようやく得られる評価は遅延報酬と呼ばれ、即時報酬が得られない難しい課題において重要な概念となります。

注意点

即時報酬の設計は非常に難しく、目先の即時報酬を過度に重視するように設定すると、エージェントが局所的な最適解に陥り、ゲームに勝利する、あるいはタスクを完遂するという最終的な目的(長期的な累積報酬の最大化)を達成できなくなることがあります。

更新日時: 2026年8月29日 21:21