強化学習詳細 — Q学習・方策勾配・深層強化学習

エージェント・状態・行動・報酬・方策の関係、Q学習と方策勾配の違い、DQN/AlphaGo まで整理。

強化学習は AP 基礎理論で出題頻度が増加中。エージェント・環境・報酬・状態の関係と、Q学習・方策勾配の違いを押さえます。

砂原 ニコ(普段) 砂原 ニコ

強化学習って、ロボットが試行錯誤しながら覚えてくやつ?

緒方 ナオミ 先生(笑顔) 緒方 ナオミ 先生

そのイメージで OK よ。
強化学習 は『エージェント』が『環境』で行動し、得られる『報酬』を最大化する方策を学ぶ枠組みよ。

鳴海 理央(普段) 鳴海 理央

中心要素は4つです。
① 状態 (state)、② 行動 (action)、③ 報酬 (reward)、④ 方策 (policy)。
状態 s で行動 a を取り、報酬 r を得て次の状態 s' に遷移する、という流れを繰り返します。

藤咲 まりあ(普段) 藤咲 まりあ

Q学習 って聞いたことありますぅ

鳴海 理央(普段) 鳴海 理央

Q学習は『状態 s で行動 a を取ったときの将来期待報酬 Q(s,a)』を学習する代表的なアルゴリズムです。
Q値テーブルを更新していくことで、最適な方策を導きます。

緒方 ナオミ 先生(普段) 緒方 ナオミ 先生

方策勾配は別のアプローチで、方策 π(a|s) (状態 s で行動 a を取る確率) を直接更新する方法なのよ。
連続的な行動空間に向いているわ。
Q学習と方策勾配を組合せたのが Actor-Critic 法ね。

砂原 ニコ(普段) 砂原 ニコ

じゃあ深層強化学習 (DRL) は?

鳴海 理央(普段) 鳴海 理央

Q学習や方策勾配にニューラルネットワークを組合せた手法です。
DeepMind の DQN (Atari ゲーム制覇) や、AlphaGo・AlphaZero (囲碁/将棋) で有名になりました。

緒方 ナオミ 先生(普段) 緒方 ナオミ 先生

AP では『強化学習の4要素 (状態・行動・報酬・方策)』『Q学習の概念』『教師あり/なし学習との違い』が頻出。
Atari・AlphaGo の事例も問われやすい。

確認クイズ

強化学習における『方策 (Policy)』の説明として、最も適切なものはどれか。

  1. 学習データのラベル
  2. 状態 s において、各行動 a を選ぶ確率 (または決定的な対応)
  3. 過去の報酬の累積値
  4. 状態遷移の確率分布
こたえを見る

正解: 2. 状態 s において、各行動 a を選ぶ確率 (または決定的な対応)

方策 π は『状態 s で行動 a を選ぶルール』。確率的方策 π(a|s) と決定的方策 a=π(s) がある。1 は教師あり学習の概念、3 は累積報酬 (return)、4 は遷移確率 P(s'|s,a)。

緒方ナオミ先生、鳴海理央、藤咲まりあ、砂原ニコが校庭のガーデニングを楽しむ様子

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。