【G検定過去問風テスト】データ拡張の目的と「テストデータ」に関する罠<

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

データ拡張(Data Augmentation)の目的や適用方法に関する説明として、最も適切な選択肢を1つ選べ。

  • A)モデルの最終的な予測精度を厳密に測定するため、本番の評価用データ(テストデータ)に対してデータ拡張を適用してデータを水増しする。
  • B)AIモデルが特定の訓練データだけを丸暗記してしまう過学習(オーバーフィッティング)を防ぎ、未知のデータに対する汎化性能を高めるために、主に訓練データに対して適用する。
  • C)画像データを左右反転や回転させる手法は、自然言語処理(テキストデータ)のモデルに対してもそのまま完全に適用できる。
  • D)データ拡張は、十分な量の学習用データが最初から潤沢にそろっている場合にのみ有効なアプローチである。
🔍 ここをクリックして正解を見る
  • 正解: ○)B)AIモデルが特定の訓練データだけを丸暗記してしまう過学習(オーバーフィッティング)を防ぎ、未知のデータに対する汎化性能を高めるために、主に訓練データに対して適用する。

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • データ拡張の最大の目的は、過学習の防止と汎化性能の向上である。
  • 鍛えるための「訓練データ」に対して行い、実力を測る「テストデータ」には絶対に適用してはいけない。

■ 初学者向け解説(例え話や背景)

模擬試験(テストデータ)の問題を勝手に改変して水増ししたら、本番の正確な実力が測れなくなってしまいますよね。データ拡張はあくまで「練習用の問題集(訓練データ)」を工夫してバリエーションを増やすためのテクニックです。この「どこに適用するか」のすり替えはG検定の定番の罠なので、しっかり押さえておきましょう!


■ 選択肢の解説

  • A) テストデータへの適用(×): テストデータにデータ拡張を行うとデータリーケージを引き起こすため不適切です。
  • B) 訓練データへの適用と過学習防止(○): データ拡張の本来の目的と正しい適用フェーズを述べた記述です。
  • C) 自然言語への流用(×): 画像の反転や回転をそのままテキストに適用することはできません。
  • D) データが潤沢な場合のみ(×): データが不足している現場の課題を解決するための技術であるため誤りです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?