【G検定過去問風テスト】強化学習の探索効率を上げるノイジーネットワークとは?

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

強化学習において重要な「探索(普段選ばない新しい行動を試すこと)」を効率化するため、従来の確率的な手法の代わりにネットワークの重みパラメータ自体にランダム性を混入させる手法として、最も適切な選択肢を1つ選べ。

  • A)デュエリングネットワーク
  • B)ダブル DQN
  • C)ノイジーネットワーク
  • D)プライオリタイズド・エクスペリエンス・リプレイ
🔍 ここをクリックして正解を見る
  • 正解: C)ノイジーネットワーク

💡 合格に近づく!徹底解説

  • 重要度: ★★☆

■ 1分で分かる!この問題の要点

  • ノイジーネットワーク(Noisy Network)は、ネットワークの重みパラメータにノイズ(ランダム性)を加える技術である。
  • 従来の確率的アプローチに頼らず、AIが自発的かつ効率的に新しい行動の「探索」を行えるようにするDQNの拡張モデルの一つである。

■ 初学者向け解説(例え話や背景)

強化学習では、いつも同じ安全な行動ばかり選んでいると、もっと良いルートや効率的な方法を発見できません。そこで、あえて普段と違うことをする「探索」が必要になります。

これを人間の行動で例えるなら、「いつもと違う裏道をあえて通ってみる冒険心」のようなものです。
従来のやり方は、コイン投げの確率でたまにランダムな行動をとらせていましたが、ノイジーネットワークは「脳の配線(パラメータ)自体に絶妙なゆらぎ(ノイズ)を持たせる」ことで、状況に応じたスマートな試行錯誤を自動的に行えるようにします。名前の通り、ネットワークに「ノイズ」を組み込むのが特徴です!


■ 選択肢の解説

  • A) デュエリングネットワーク(×): 出力を「状態自体の価値V(s)」と「各行動のアドバンテージA(s,a)」に分解して推定する構造です。
  • B) ダブル DQN(×): 行動を選ぶネットワークとQ値を評価するネットワークを分離し、過大評価を防ぐモデルです。
  • C) ノイジーネットワーク(○): 重みパラメータにノイズを混入させて効率的な探索を実現する手法であり、本問の正解です。
  • D) プライオリタイズド・エクスペリエンス・リプレイ(×): 重要な(学びの大きい)経験データを優先的にサンプリングして学習効率を高める手法です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?