【G検定過去問風テスト】特徴量の増加がもたらす機械学習の落とし穴とは?

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

予測モデルの精度を向上させるために、分析に用いる「特徴量の数(次元)」を増やすアプローチが考えられる。しかし、次元を増やしすぎると、データ空間の体積が指数関数的に増大し、限られたデータ量では空間内がスカスカになってしまい、かえって学習がうまく進まなくなる現象を何と呼ぶか。最も適切な選択肢を1つ選べ。

  • A)オーバーフィッティング
  • B)次元の呪い
  • C)局所最適解
  • D)勾配消失問題
🔍 ここをクリックして正解を見る

  • 正解: B)次元の呪い

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • 特徴量(分析の切り口)を増やしすぎると、データが散らばって共通点を見つけにくくなる。
  • データ空間が「スカスカ」になるこの現象を「次元の呪い」と呼び、機械学習の設計において避けるべき超重要テーマ。

■ 初学者向け解説(例え話や背景)

この現象は、「だだっ広い100階建ての巨大デパートで、友達とかくれんぼをする」ようなものです。

もし「1階のワンフロア(1次元)」だけでかくれんぼをすれば、範囲が狭いのですぐに友達を見つけることができますよね(データが密集している状態)。
しかし、これが「100階建てのビル(100次元)」に拡張されたらどうでしょう?
部屋やフロアの数が多すぎて、友達を見つけ出すのは不可能に近くなります(データがスカスカな状態)。

AIの世界でも全く同じです。予測の精度を上げようとして「あれもこれも」と分析する項目(次元)を増やしすぎると、データ空間が天文学的に広がり、データ同士の共通のパターンが埋もれて見つけ出せなくなってしまいます。試験では「次元を増やすと密度が高まり効率化する」という逆のひっかけパターンが頻出なので注意しましょう!


■ 選択肢の解説

  • A) オーバーフィッティング(×): 日本語では「過学習」と呼びます。訓練データにばかり過剰に適応してしまい、本番(未知のデータ)での予測精度が落ちてしまう現象のことです。
  • B) 次元の呪い(○): 特徴量(次元)の増加に伴ってデータ空間が爆発的に広がり、学習が困難になる現象を指す正しい説明です。
  • C) 局所最適解(×): 全体の中での本当のベスト(全体最適解)ではない、局所的な最適解のことです。
  • D) 勾配消失問題(×): 層の深いネットワークにおけるディープラーニングにおいて、出力層側から遡るエラーの情報(勾配)が掛け算の繰り返しによって極端に小さくなり、入力層に近い浅い層が更新されず学習が進まなくなる現象です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?