【G検定過去問風テスト】強化学習の探索効率を上げるノイジーネットワークとは?
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
強化学習において重要な「探索(普段選ばない新しい行動を試すこと)」を効率化するため、従来の確率的な手法の代わりにネットワークの重みパラメータ自体にランダム性を混入させる手法として、最も適切な選択肢を1つ選べ。
- A)デュエリングネットワーク
- B)ダブル DQN
- C)ノイジーネットワーク
- D)プライオリタイズド・エクスペリエンス・リプレイ
🔍 ここをクリックして正解を見る
- 正解: C)ノイジーネットワーク
💡 合格に近づく!徹底解説
- 重要度: ★★☆
■ 1分で分かる!この問題の要点
- ノイジーネットワーク(Noisy Network)は、ネットワークの重みパラメータにノイズ(ランダム性)を加える技術である。
- 従来の確率的アプローチに頼らず、AIが自発的かつ効率的に新しい行動の「探索」を行えるようにするDQNの拡張モデルの一つである。
■ 初学者向け解説(例え話や背景)
強化学習では、いつも同じ安全な行動ばかり選んでいると、もっと良いルートや効率的な方法を発見できません。そこで、あえて普段と違うことをする「探索」が必要になります。
これを人間の行動で例えるなら、「いつもと違う裏道をあえて通ってみる冒険心」のようなものです。
従来のやり方は、コイン投げの確率でたまにランダムな行動をとらせていましたが、ノイジーネットワークは「脳の配線(パラメータ)自体に絶妙なゆらぎ(ノイズ)を持たせる」ことで、状況に応じたスマートな試行錯誤を自動的に行えるようにします。名前の通り、ネットワークに「ノイズ」を組み込むのが特徴です!
■ 選択肢の解説
- A) デュエリングネットワーク(×): 出力を「状態自体の価値V(s)」と「各行動のアドバンテージA(s,a)」に分解して推定する構造です。
- B) ダブル DQN(×): 行動を選ぶネットワークとQ値を評価するネットワークを分離し、過大評価を防ぐモデルです。
- C) ノイジーネットワーク(○): 重みパラメータにノイズを混入させて効率的な探索を実現する手法であり、本問の正解です。
- D) プライオリタイズド・エクスペリエンス・リプレイ(×): 重要な(学びの大きい)経験データを優先的にサンプリングして学習効率を高める手法です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
