強化学習は AP 基礎理論で出題頻度が増加中。エージェント・環境・報酬・状態の関係と、Q学習・方策勾配の違いを押さえます。
強化学習って、ロボットが試行錯誤しながら覚えてくやつ?
そのイメージで OK よ。
強化学習 は『エージェント』が『環境』で行動し、得られる『報酬』を最大化する方策を学ぶ枠組みよ。
中心要素は4つです。
① 状態 (state)、② 行動 (action)、③ 報酬 (reward)、④ 方策 (policy)。
状態 s で行動 a を取り、報酬 r を得て次の状態 s' に遷移する、という流れを繰り返します。
Q学習 って聞いたことありますぅ
Q学習は『状態 s で行動 a を取ったときの将来期待報酬 Q(s,a)』を学習する代表的なアルゴリズムです。
Q値テーブルを更新していくことで、最適な方策を導きます。
方策勾配は別のアプローチで、方策 π(a|s) (状態 s で行動 a を取る確率) を直接更新する方法なのよ。
連続的な行動空間に向いているわ。
Q学習と方策勾配を組合せたのが Actor-Critic 法ね。
じゃあ深層強化学習 (DRL) は?
Q学習や方策勾配にニューラルネットワークを組合せた手法です。
DeepMind の DQN (Atari ゲーム制覇) や、AlphaGo・AlphaZero (囲碁/将棋) で有名になりました。
AP では『強化学習の4要素 (状態・行動・報酬・方策)』『Q学習の概念』『教師あり/なし学習との違い』が頻出。
Atari・AlphaGo の事例も問われやすい。
確認クイズ
強化学習における『方策 (Policy)』の説明として、最も適切なものはどれか。
- 学習データのラベル
- 状態 s において、各行動 a を選ぶ確率 (または決定的な対応)
- 過去の報酬の累積値
- 状態遷移の確率分布
こたえを見る
正解: 2. 状態 s において、各行動 a を選ぶ確率 (または決定的な対応)
方策 π は『状態 s で行動 a を選ぶルール』。確率的方策 π(a|s) と決定的方策 a=π(s) がある。1 は教師あり学習の概念、3 は累積報酬 (return)、4 は遷移確率 P(s'|s,a)。