【G検定過去問風テスト】Q値の過大評価を防ぐダブル DQNとは?

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

通常のDQNにおける「Q値(行動の価値)を過大評価しやすい」という欠点を解決するため、行動を選ぶネットワークとそのQ値を評価するネットワークを2つに分離したモデルとして、最も適切な選択肢を1つ選べ。

  • A)DQN
  • B)ダブル DQN
  • C)デュエリングネットワーク
  • D)Rainbow
🔍 ここをクリックして正解を見る
  • 正解: B)ダブル DQN

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • ダブル DQN(Double DQN)は、Q値の過大評価問題を抑えるために生み出されたDQNの拡張モデルである。
  • 「行動を選ぶネットワーク」と「その行動の価値(Q値)を評価するネットワーク」を2つに分けることが最大の特徴である。

■ 初学者向け解説(例え話や背景)

通常のDQNは、「この行動ならきっとすごい高得点が取れるはずだ!」と楽観的に見積もりすぎてしまい、実際には大失敗してしまう(Q値の過大評価)というクセがありました。これは、自分で自分のアイデアの採点までやってしまう状態に似ています。

これを防ぐための工夫が「自分で選んだアイデアを、もう一人の自分(客観的な評価役)に厳しくジャッジしてもらうこと」です!
ダブル DQNでは、「どの行動を選ぶか」を決めるネットワークと、「その選ばれた行動の点数は本当に妥当か」を評価するネットワークを別々に用意します。お互いにチェック機能を働かせることで、楽観的な思い込みをなくし、より正確で安定した学習ができるようになります。


■ 選択肢の解説

  • A) DQN(×): ディープラーニングとQ学習を融合させた記念碑的モデルですが、Q値を過大評価しやすいという課題があります。
  • B) ダブル DQN(○): 行動選択と価値評価の2つのネットワークを分離して過大評価を防ぐモデルであり、本問の正解です。
  • C) デュエリングネットワーク(×): 出力を「状態自体の価値V(s)」と「各行動のアドバンテージA(s,a)」に分解して推定する構造です。
  • D) Rainbow(×): DQNに提案された主要な7つの改善手法をすべて統合した最強モデルです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?