【G検定過去問風テスト】自然言語処理のサクセスストーリー!翻訳AIの進化

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

人間が日常的に用いる言葉をコンピュータに処理させる「自然言語処理」の歴史と手法に関する記述として、最も適切な選択肢を1つ選べ。

  • A)初期の自然言語処理では、大量のテキストデータから言葉のつながりを確率計算する「統計的自然言語処理」が主流であったが、データ不足を補うために、文法規則を人手で定義するルールベースの手法へとシフトした。
  • B)初期の自然言語処理では、文法規則や辞書を人力で記述するルールベースの手法が用いられたが、言葉の例外や曖昧さに対応しきれず、のちに大量のテキストデータから言葉のつながりの確率を計算する「統計的自然言語処理」が主流となった。
  • C)統計的自然言語処理は、人間が文法ルールを徹底的に覚え込ませることで、不自然な直訳を完全に排除し、きわめて自然な翻訳文を生成することに成功した手法である。
  • D)現在の自然言語処理はルールベースの手法のみに原点回帰しており、計算コストの大きい統計的なアプローチやデータ依存型の手法は一切使われなくなっている。
🔍 ここをクリックして正解を見る

  • 正解: B)初期の自然言語処理では、文法規則や辞書を人手で記述するルールベースの手法が用いられたが、言葉の例外や曖昧さに対応しきれず、のちに大量のテキストデータから言葉のつながりの確率を計算する「統計的自然言語処理」が主流となった。

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • 歴史の順番は「文法規則(ルールベース)」⇒「確率・統計(機械学習ベース)」の流れ。
  • 昔は人間がルールを作っていたが、言葉の複雑さに限界を迎え、大量の文章データから「統計的」に最も確率の高い言葉のつながりを選ぶ仕組みへと進化しました。

■ 初学者向け解説(例え話や背景)

言葉を翻訳したり解釈したりする技術の歴史は、「英文法の教科書をガリ勉した翻訳家」から「海外の超大量の本を読みまくってニュアンスで覚えた翻訳家」への進化に例えられます。

  • 昔:文法ルールで戦った時代(ルールベース)

    「『吾輩は猫である』は、主語が『吾輩』で、述語が『猫である』だから、英語に当てはめると……」と、辞書とルールを1つずつコンピュータに教え込んでいました。しかし、「空気を読む」「文脈で意味が変わる」といった日本語ならではの例外に対応できず、不自然な翻訳しか作れませんでした。
  • 今:データと確率で戦う時代(統計的自然言語処理)

    辞書を覚え込ませるのを諦め、インターネット上にある膨大な「日本語と英語のペア文章」を丸ごと読み込ませました。そして、「日本語で『吾輩は猫である』と言っているとき、英語の文章では統計的に『I am a cat』と書かれている確率が一番高いぞ!」と、言葉の組み合わせの確率を計算して処理するようになったのです。

試験では、この「進化の歴史の順番(ルールから統計へ)」をあえて逆にして受験生を混乱させるひっかけが定番となっています。全体の流れをすっきり覚えておきましょう!


■ 選択肢の解説

  • A) 初期の自然言語処理では、大量 of テキストデータから…(×): 歴史の順番が真逆です。初期は「ルールベース」から始まり、その後に「統計的自然言語処理」へと移行しました。
  • B) 初期の自然言語処理では、文法規則や辞書を…(○): 自然言語処理の歴史的変遷を正しく説明しています。
  • C) 統計的自然言語処理は、人間が文法ルールを…(×): 「統計的自然言語処理」はルールベースではなく、大量のテキストデータから「確率(統計)」を計算して処理する手法です。文法ルールを覚え込ませるものではありません。
  • D) 現在の自然言語処理はルールベースの手法のみに…(×): 現在のAI翻訳やLLM(大規模言語モデル)の基盤は統計的アプローチやディープラーニングであり、ルールベースのみに逆行しているという事実はありません。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?