【G検定過去問風テスト】学習をスムーズにする報酬成形とは?

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

ゴールした時しか報酬がもらえないような報酬までが遠い課題において、学習をスムーズにするため人間が中間報酬やヒントを与えて導く技術として、最も適切な選択肢を1つ選べ。

  • A)報酬成形
  • B)状態表現学習
  • C)オフライン強化学習
  • D)ドメインランダマイゼーション
🔍 ここをクリックして正解を見る
  • 正解: A)報酬成形

💡 合格に近づく!徹底解説

  • 重要度: ★★☆

■ 1分で分かる!この問題の要点

  • 報酬成形(Reward Shaping)は、ゴールの到達が難しいタスクで、途中に「中間報酬(ヒント)」を設計して学習を誘導する技術である。
  • ただし、設計を誤るとゴールを目指さずに中間報酬ばかりを狙う「報酬ハック」が起きるリスクがある。

■ 初学者向け解説(例え話や背景)

迷路のゲームで、出口(ゴール)を抜け出した時だけにしかポイントがもらえない場合、広大な迷路の中をさまよい続けるうちにAIも途方に暮れてしまいますよね。

報酬成形を子供の教育に例えるなら、「最後までできた時だけでなく、途中で良いアプローチができたら『よくできたね!』とこまめに褒めてあげるご褒美作戦」です。
正しい方向へ進むたびに小さなご褒美(ヒント)を与えることで、効率よくゴールへの道筋を学習させることができます。ただし、「褒め方」を間違えると、AIがゴールそっちのけでご褒美をもらえる場所を行ったり来たりしてしまう(報酬ハック)という落とし穴もあるので注意が必要です。


■ 選択肢の解説

  • A) 報酬成形(○): ゴールが遠い課題で中間報酬を与えて学習をスムーズにする技術であり、本問の正解です。
  • B) 状態表現学習(×): 複雑な高次元データから制御に必要な本質的な状態情報だけを低次元で抽出する手法です。
  • C) オフライン強化学習(×): 環境と試行錯誤を行わず、過去の固定データセットのみを使って学習する手法です。
  • D) ドメインランダマイゼーション(×): シミュレータの条件をあえてランダムに変化させて現実適応力を高める手法です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?