【G検定過去問風テスト】オフライン強化学習に関する一問一答

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

環境とリアルタイムで試行錯誤を行わず、過去に収集された固定データセットのみを使って方策を学習する手法として、最も適切な選択肢を1つ選べ。

  • A)オンライン強化学習
  • B)オフライン強化学習
  • C)残差強化学習
  • D)マルチエージェント強化学習
🔍 ここをクリックして正解を見る
  • 正解: B)オフライン強化学習

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • オフライン強化学習は、環境とインタラクション(試行錯誤)を行わず、過去のログデータだけで学習を進める手法である。
  • 医療や自動運転など、現実世界で失敗(試行錯誤)させると危険・事故につながる領域で極めて重要視されている。

■ 初学者向け解説(例え話や背景)

通常の強化学習は「とにかく何万回も失敗してそこから学ぶ(試行錯誤)」のが基本ですが、自動運転や医療の現場でこれをやると、AIが下手な運転をして事故を起こしたり、患者さんに危険な治療を試してしまったりするため絶対に許されませんよね。

そこで使われるのが「安全な運転記録や医療カルテ(過去の固定データ)のビデオを見ながらデスクの上だけで勉強する」というオフライン強化学習です!
実環境に飛び出して危険な失敗を繰り返す必要がないため、安全かつ効率的に賢いポリシーを獲得できるアプローチとして、G検定でも大注目のトピックです。


■ 選択肢の解説

  • A) オンライン強化学習(×): 環境とリアルタイムで実際に試行錯誤を繰り返しながら学習を進める従来の手法です。
  • B) オフライン強化学習(○): 環境と試行錯誤を行わず、過去の固定データセットのみを使って学習する手法であり、本問の正解です。
  • C) 残差強化学習(×): 既存の古典的な制御ルールの出力をベースにし、AIはその補正分(残差)だけを学習する効率的な手法です。
  • D) マルチエージェント強化学習(×): 複数のAIが互いに協力したり対戦したりしながら学習する枠組みです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?