【G検定過去問風テスト】Q学習とSARSAの違いとは?バンディットアルゴリズムの頻出問題を徹底解説!

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

強化学習における価値ベースの学習アルゴリズムおよび方策に関する説明として、最も適切な選択肢を1つ選べ。

  • A)Q学習は、次のステップで自分が実際に選択した行動を元にして現実的に行動価値(Q値)を更新する「オンポリシー型」の手法である。
  • B)SARSAは、次のステップで選択可能な行動のうち、最も高い価値を持つ行動をとったと仮定して強気に価値を更新する「オフポリシー型」の手法である。
  • C)イプシロン・グリーディ(ε-greedy)方策は、データが少なくて不確実性が高い行動ほど優先的に選択確率を高める手法である。
  • D)バンディットアルゴリズムにおける「利用」と「探索」は同時に最大化することができないトレードオフの関係にある。
🔍 ここをクリックして正解を見る
  • 正解: D)バンディットアルゴリズムにおける「利用」と「探索」は同時に最大化することができないトレードオフの関係にある。

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • 利用(安全な道)探索(冒険)は、両立できないトレードオフの関係
  • Q学習=強気・理想主義(最大値MAXで更新)のオフポリシー型!
  • SARSA=堅実・現実主義(実際に選んだ行動で更新)のオンポリシー型!
  • ε-greedy=おみくじ(確率εで完全ランダム)
  • UCB=好奇心(データ不足・不確実性が高いものを狙う)

■ 初学者向け解説(例え話や背景)

強化学習で最も引っかかりやすいのが「Q学習 vs SARSA」と「ε-greedy vs UCB」の組み合わせ問題です!

まず、カジノのスロットマシンを想像してください。
「過去に一番当たった台を打ち続ける(利用)」と、「まだ打っていない怪しい台に挑戦する(探索)」。どちらか一方をとればもう片方は犠牲になるため、この2つはトレードオフの関係にあります。

この冒険の仕方の違いが、ε-greedy(確率εでおみくじを引くように完全ランダム選択)UCB(「まだよく分からんから試してみよう!」と不確実性が高い台を狙う)です。

そして、見積書(Q値)の更新ロジックの違いが「Q学習 vs SARSA」です。

  • Q学習(強気な理想主義者):「次のステップで、もし自分が最強の行動(最大値)をとったとしたら…」と仮定して見積もる(オフポリシー型)。
  • SARSA(慎重な現実主義者):「理想論は置いておいて、次のステップで自分が実際に選択したリアルな行動」を元に見積もる(オンポリシー型)。

試験では、この2つの定義をあえて逆にして受験生を惑わすトラップが頻出します!


■ 選択肢の解説

  • A) Q学習は、次のステップで自分が実際に選択した行動を元にして現実的に行動価値(Q値)を更新する「オンポリシー型」の手法である。(×): 不適切です。記述内容は「SARSA」の説明です。Q学習は「もし最大値の行動をとったら」と仮定するオフポリシー型です。
  • B) SARSAは、次のステップで選択可能な行動のうち、最も高い価値を持つ行動をとったと仮定して強気に価値を更新する「オフポリシー型」の手法である。(×): 不適切です。記述内容は「Q学習」の説明です。主語が入れ替えられた典型的なひっかけ選択肢です。
  • C) イプシロン・グリーディ(ε-greedy)方策は、データが少なくて不確実性が高い行動ほど優先的に選択確率を高める手法である。(×): 不適切です。記述内容は「UCB方策」の説明です。ε-greedyは一定の確率εで「完全ランダム」に行動を選びます。
  • D) バンディットアルゴリズムにおける「利用」と「探索」は同時に最大化することができないトレードオフの関係にある。(○): 正しい(正解)です。過去の最適行動をとること(利用)と、未知の行動を試すこと(探索)は相反するトレードオフの関係にあります。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?