【G検定過去問風テスト】自然言語処理の基礎!「コーパス」の定義と役割を徹底解説
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
自然言語処理(NLP)において、形態素解析や構文分析などの情報が付与された、構造化された「大量の言語データ群」を指す用語として、最も適切な選択肢を1つ選べ。
- A)アノテーション
- B)コーパス
- C)オープンデータセット
- D)データリーケージ
🔍 ここをクリックして正解を見る
- 正解: B)コーパス
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- コーパスは、自然言語処理の学習や分析に使われる「大量の構造化されたテキストデータ群」である。
- 単なるネット上の文章の集まりではなく、解析しやすいように情報が付与されているのが特徴。
■ 初学者向け解説(例え話や背景)
国語や英語の試験勉強で、過去問や長文読解のサンプルをたくさん集めた「膨大な問題集・単語集」を思い浮かべてみてください。AIに言葉の意味や文脈を正しく教えるためにも、人間が書いた大量の文章データが必要になります。この「言語データの集まり」がコーパスです。
■ 選択肢の解説
- A) アノテーション(×): テキストや画像などのデータに対して、AIが学習できるように「正解ラベル」を付与する作業のことです。
- B) コーパス(○): 自然言語処理の研究や開発で利用される、**文章や発話などの大量の言語データを収集・蓄積したデータベース(言語資料)**のことです。
- C) オープンデータセット(×): 研究機関や企業などが一般に無料公開しているデータセット全般を指します。
- D) データリーケージ(×): 訓練データにテストデータ(検証データ)の情報や未来の情報が誤って混入し、見かけ上の評価精度が異常に高く(過剰に良く)なってしまう現象です。これにより、実運用時(未知のデータに対する予測)で性能が大きく低下します。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?

