【G検定過去問風テスト】実運用で失敗しない!「データリーケージ」の恐怖と対策

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

本来は訓練データに含めてはいけないテストデータの情報や、将来得られる情報が誤って訓練データに混入してしまうことで、学習時の評価精度は高く見えるものの未知のデータに対して著しく予測精度が低下する現象として、最も適切な選択肢を1つ選べ。

  • A)アノテーション
  • B)データリーケージ
  • C)オープンデータセット
  • D)コーパス
🔍 ここをクリックして正解を見る
  • 正解: B)データリーケージ

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • データリーケージは、訓練データにテストデータ(答え)が漏洩してしまう現象である。
  • 答えを知った状態で勉強しているため模試では満点が取れるが、本番の未知の問題で全く解けなくなる状態を指す。

■ 初学者向け解説(例え話や背景)

テスト勉強をするときに、出題で出される問題と解答がそのまま問題集に混ざっていたらどうなるでしょうか?当然、その問題集を使った自己採点では満点が取れますが、いざ本当の試験(未知のデータ)を受けたときには全く歯が立ちませんよね。AI開発においても、前処理の段階で全体平均を使ってしまうなど、うっかり「答え」を漏れさせてしまうとこの悲劇が起きます。


■ 選択肢の解説

  • A) アノテーション(×): データに正解ラベルや関連情報を付与し、教師データを作成する作業のことです。
  • B) データリーケージ(○): 訓練データにテストデータ(検証データ)の情報や未来の情報が誤って混入し、見かけ上の評価精度が異常に高く(過剰に良く)なってしまう現象です。これにより、実運用時(未知のデータに対する予測)で性能が大きく低下します。
  • C) オープンデータセット(×): 研究機関や企業などが一般に無料公開しているデータセット全般を指します。
  • D) コーパス(×): 自然言語処理の研究や開発で利用される、文章や発話などの大量の言語データを収集・蓄積したデータベース(言語資料)のことです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?