【G検定過去問風テスト】サンプリングバイアスとデータ収集の注意点

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

画像認識AIにおいて、特定の肌の色や属性のグループに対して著しく認識精度が低くなってしまった。この現象を引き起こす主な原因として、最も適切な選択肢を1つ選べ。

  • A)AIのアルゴリズムが意図的に特定のグループを差別するよう悪意を持ってプログラミングされたためである。
  • B)訓練データセットを収集する際、特定グループのデータが極端に不足していたためである。
  • C)入力画像に対して量子化やモデル圧縮の処理のみを過剰に行ったことが唯一の原因である。
  • D)検証データからすべてのセンシティブ属性を完全に削除し忘れたためである。
🔍 ここをクリックして正解を見る
  • 正解: B)訓練データセットを収集する際、特定グループのデータが極端に不足していたためである。

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • AIが特定のグループだけ認識エラーを起こす原因の多くは、学習データにおける偏り(サンプリングバイアス)にある。
  • AI自体が悪意を持って差別しているわけではなく、偏ったデータから学習した結果として精度に差が生まれる。

■ 初学者向け解説(例え話や背景)

学校のテスト勉強に例えてみましょう。もし「特定の単元A」の問題ばかりを100問解いて、「単元B」の問題を1問も解かずに本番の試験を迎えたら、単元Bが出たときに全く解けませんよね。それと同じで、画像認識AIの学習データに「特定のグループ(肌の色や性別など)」の写真がほとんど含まれていないと、AIはそのグループの顔を正しく見分ける勉強ができていないため、認識精度がガクッと落ちてしまいます。このように、データを集める段階で偏りが出てしまう状態を「サンプリングバイアス」と呼びます。


■ 選択肢の解説

  • A) AIのアルゴリズムが意図的に...(×): AIが自分で悪意を持って差別するわけではありません。原因はデータや設計の偏りにあります。
  • B) 訓練データセットを収集する際、特定グループのデータが極端に不足していた...(○): 正解です!データの収集段階における偏り(サンプリングバイアス)が原因で精度低下が起こります。
  • C) 入力画像に対して量子化やモデル圧縮...(×): 量子化などはエプロンデバイス等での軽量化手法であり、特定のグループの認識精度低下の主な直接原因ではありません。
  • D) 検証データからすべてのセンシティブ属性を完全...(×): センシティブ属性の有無に関わらず、学習データの偏りが根本的な原因となります。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?