【G検定過去問風テスト】Q値の過大評価を防ぐダブル DQNとは?
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
通常のDQNにおける「Q値(行動の価値)を過大評価しやすい」という欠点を解決するため、行動を選ぶネットワークとそのQ値を評価するネットワークを2つに分離したモデルとして、最も適切な選択肢を1つ選べ。
- A)DQN
- B)ダブル DQN
- C)デュエリングネットワーク
- D)Rainbow
🔍 ここをクリックして正解を見る
- 正解: B)ダブル DQN
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- ダブル DQN(Double DQN)は、Q値の過大評価問題を抑えるために生み出されたDQNの拡張モデルである。
- 「行動を選ぶネットワーク」と「その行動の価値(Q値)を評価するネットワーク」を2つに分けることが最大の特徴である。
■ 初学者向け解説(例え話や背景)
通常のDQNは、「この行動ならきっとすごい高得点が取れるはずだ!」と楽観的に見積もりすぎてしまい、実際には大失敗してしまう(Q値の過大評価)というクセがありました。これは、自分で自分のアイデアの採点までやってしまう状態に似ています。
これを防ぐための工夫が「自分で選んだアイデアを、もう一人の自分(客観的な評価役)に厳しくジャッジしてもらうこと」です!
ダブル DQNでは、「どの行動を選ぶか」を決めるネットワークと、「その選ばれた行動の点数は本当に妥当か」を評価するネットワークを別々に用意します。お互いにチェック機能を働かせることで、楽観的な思い込みをなくし、より正確で安定した学習ができるようになります。
■ 選択肢の解説
- A) DQN(×): ディープラーニングとQ学習を融合させた記念碑的モデルですが、Q値を過大評価しやすいという課題があります。
- B) ダブル DQN(○): 行動選択と価値評価の2つのネットワークを分離して過大評価を防ぐモデルであり、本問の正解です。
- C) デュエリングネットワーク(×): 出力を「状態自体の価値V(s)」と「各行動のアドバンテージA(s,a)」に分解して推定する構造です。
- D) Rainbow(×): DQNに提案された主要な7つの改善手法をすべて統合した最強モデルです。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
