【G検定過去問風テスト】自然言語処理の基礎!「コーパス」の定義と役割を徹底解説

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

自然言語処理(NLP)において、形態素解析や構文分析などの情報が付与された、構造化された「大量の言語データ群」を指す用語として、最も適切な選択肢を1つ選べ。

  • A)アノテーション
  • B)コーパス
  • C)オープンデータセット
  • D)データリーケージ
🔍 ここをクリックして正解を見る
  • 正解: B)コーパス

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • コーパスは、自然言語処理の学習や分析に使われる「大量の構造化されたテキストデータ群」である。
  • 単なるネット上の文章の集まりではなく、解析しやすいように情報が付与されているのが特徴。

■ 初学者向け解説(例え話や背景)

国語や英語の試験勉強で、過去問や長文読解のサンプルをたくさん集めた「膨大な問題集・単語集」を思い浮かべてみてください。AIに言葉の意味や文脈を正しく教えるためにも、人間が書いた大量の文章データが必要になります。この「言語データの集まり」がコーパスです。


■ 選択肢の解説

  • A) アノテーション(×): テキストや画像などのデータに対して、AIが学習できるように「正解ラベル」を付与する作業のことです。
  • B) コーパス(○): 自然言語処理の研究や開発で利用される、**文章や発話などの大量の言語データを収集・蓄積したデータベース(言語資料)**のことです。
  • C) オープンデータセット(×): 研究機関や企業などが一般に無料公開しているデータセット全般を指します。
  • D) データリーケージ(×): 訓練データにテストデータ(検証データ)の情報や未来の情報が誤って混入し、見かけ上の評価精度が異常に高く(過剰に良く)なってしまう現象です。これにより、実運用時(未知のデータに対する予測)で性能が大きく低下します。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?