【G検定対策】自然言語処理(NLP)の最重要キーワード25選!Word2VecからLLM・BERTまで完全解説

※本記事では、アフィリエイトプログラムより教材を紹介しています。

【重要度】★★★

G検定の「自然言語処理(NLP)」分野は、専門用語やアルファベット表記のモデル名(Word2Vec, BERT, LLMなど)が非常に多く、受験生が混同しやすい難所の一つです。
「ワンホットベクトルと分散表現って何が違うの?」「CBOWとスキップグラムの違いが覚えられない…」と悩んでいませんか?

ご安心ください!この記事では、単語を数値化する歴史的背景から最新の大規模言語モデル(LLM)まで、G検定で理解が必要となるキーワードを身近な「例え話」で分かりやすく整理しました。
試験で狙われやすい「ひっかけパターン」や要点比較表も掲載しているので、最後まで読めばNLP分野が得点源に変わりますよ!


1. 自然言語処理(NLP)とは?分かりやすい例え話で解説

自然言語処理(NLP:Natural Language Processing)とは、私たちが普段話したり書いたりしている「言葉(自然言語)」を、コンピュータに理解・処理させる技術のことです。

コンピュータは数字しか計算できないため、人間が書いた文章をそのまま理解することはできません。
そのため、自然言語処理の本質は「いかに意味を保ったまま言葉を数字(ベクトル)に変換し、AIに計算させるか」にあります。

自然言語処理の仕組みは、言ってみれば「超優秀な外国人の翻訳秘書」のようなものです。
秘書は、日本語の文章をそのまま読むのではなく、一度「自分だけの意味数値マップ」に変換して整理します。
その数値マップをもとに、文章の要約を作成したり、感情を分析したり、別の言語へ正確に翻訳したりするイメージです。

G検定では、「単語をどう数値化してきたか(特徴表現)」の歴史と、「言葉を処理するモデル」の進化プロセスが頻出されます。
それでは、基本となるタスクとキーワードを順番に見ていきましょう!


2. 試験に出る!最重要キーワードの解説と覚え方

シラバスに登場するキーワードを、「NLPの処理プロセス・応用タスク」「特徴表現(ベクトル化)」「Word2Vecと発展モデル」「時系列・最新モデル(LLM)」の4つのグループに分けて詳しく解説します。


【NLPの処理プロセスと応用タスク】文章を分解して処理する

テキストデータをコンピュータで扱う際、段階を踏んで解析が行われます。

形態素解析

意味を持つ最小の単位である「形態素(けいたいそ)」に文章を分割し、それぞれの品詞を特定する作業です。
例えば、「すもももももももものうち」を「すもも / も / もも / も / もも / の / うち」と切り分ける処理のことです。

構文解析

形態素解析で分けた単語同士の「主語と述語の関係」や「修飾・被修飾の関係」といった文法的な構造(係り受け関係)を解析する技術です。

機械翻訳 / 統計的機械翻訳

ある言語の文章を別の言語に自動変換する技術です。
初期の「ルールベース機械翻訳」から、膨大な双訳データから確率計算で最適な訳を導く「統計的機械翻訳」へ進化し、現在はディープラーニングを用いた「ニューラル機械翻訳(NMT)」が主流となっています。

感情分析

口コミやSNSの投稿テキストから、「ネガティブ(批判的)」「ポジティブ(好意的)」「中立」などの感情や評価を自動で分類・検出するタスクです。

文書要約

長い文章の重要なポイントを抽出し、短く簡潔な要約文を自動生成するタスクです。

質問応答

「日本の首都は?」という人間の質問に対して、知識データベースやWeb上の情報から的確な答え(「東京です」)を検索・生成して返す技術です。

情報検索

ユーザーが入力した検索キーワードに対して、膨大なデータベースの中から最も関連性の高い文書やウェブページを探し出して表示するシステムです(Google検索など)。


【特徴表現・ベクトル化】言葉を「数字」に変換する手法

言葉をコンピュータに理解させるため、単語や文章を数値(ベクトル)に変換する手法の歴史です。

ワンホットベクトル(One-hot Vector)

単語を「1」と「0」の列で表現する最もシンプルな方法です。
語彙数が10,000語ある場合、該当する単語の要素だけを「1」、それ以外をすべて「0」にした10,000次元のベクトルを作ります。
単語が増えると「次元の呪い」が起きる上、「単語同士の意味の近さ(例:犬と猫は似ている等)」を表現できないという致命的な欠点があります。

BoW(Bag-of-Words)

文章中に「どの単語が何回出現したか」をカウントして文章をベクトル化する手法です。
「袋(Bag)の中に単語を放り込んだ」ように扱うため、単語の並び順(語順)が無視されるという特徴があります。

n-gram

連続するn個の単語(または文字)のまとまりを単位にしてテキストを解析する手法です。
1個ならユニグラム(Unigram)、2個ならバイグラム(Bigram)、3個ならトライグラム(Trigram)と呼びます。
語順の情報をある程度保持できるメリットがあります。

TF-IDF

文章中の単語の重要度を計算する指標です。
「特定の文章によく出る単語(TF:単語頻度)」を高く評価しつつ、「どの文章にも当たり前に出る一般的な単語(IDF:逆文書頻度)」の評価を下げる計算を行います。
例えば、「AI」という言葉が特定の記事に多ければ重要視されますが、「これ」「です」のような言葉は全記事に出るため重要度が下げられます。

分散表現 / 単語埋め込み(Word Embedding)

単語を数十〜数百次元程度の「高次元の連続値(少数)」のベクトルで表現する手法です。
ワンホットベクトルと違い、高次元空間に単語を配置することで、「単語の意味の近さや関係性」を表現可能にしました。
ベクトル演算により「王 - 男性 + 女性 = 女王」のような単語の意味の足し算・引き算ができるのが最大の特徴です。


【Word2Vecと発展モデル】単語の意味を学習する

分散表現を飛躍的に広めた代表的な手法が「Word2Vec」です。

Word2vec

2013年にトマス・ミコロフ氏らが提案した、ニューラルネットワークを用いて単語の分散表現を効率的に学習する手法です。
後述する「CBOW」と「スキップグラム」という2つのモデル構造を持ちます。

CBOW(Continuous Bag-of-Words)

Word2Vecの学習モデルの一つで、「周囲の単語(文脈)から、中央の単語(ターゲット)を予測する」手法です。
計算速度が速い、頻出語の扱いに長けています。

スキップグラム(Skip-gram)

Word2Vecのもう一つのモデルで、CBOWとは逆に「中央の単語(ターゲット)から、周囲の単語(文脈)を予測する」手法です。
CBOWよりも計算量は多いですが、低頻度(レア)な単語でも高精度なベクトルを作成できます。

fastText

Facebook(現Meta)が開発したWord2Vecの拡張モデルです。
単語をさらに細かい「文字単位のn-gram(サブワード)」に分解して学習するため、「辞書にない未知の単語(OOV:Out-of-Vocabulary)」に対しても分散表現を生成できるのが強みです。


【時系列モデルからLLMへ】文脈を捉える最新AIの進化

単語単体だけでなく、文脈全体や大量のテキストを扱うモデルへと進化しました。

Seq2Seq

Encoder(入力文をベクトルに圧縮)とDecoder(ベクトルから出力文を生成)の2つのRNNを組み合わせたモデルです。
機械翻訳や文章要約など、「入力の長さと出力の長さが異なるタスク」を可能にしました。

CEC(Constant Error Carousel)

LSTM(Long Short-Term Memory)の内部にある、誤差を減衰させずに過去へ伝え続ける誤差カルーセル(CEC)と呼ばれる仕組みのことです。
勾配を減衰させずに過去の情報を保持し続けることで、RNNの弱点だった「勾配消失問題」を解決しました。

ELMo(Embeddings from Language Models)

双方向LSTMを用いて、「文脈によって意味が変わる単語」を適切にベクトル化(文脈依存の単語埋め込み)できるようにしたモデルです。
例えば、「銀行(Bank)」と「川の岸(Bank)」のような同音異義語を文脈に応じて正しく区別できます。

BERT

TransformerのEncoder部分を利用し、大量のテキストから「事前学習(Self-Attentionによる双方向処理)」を行った画期的なモデルです。
文章の一部を穴埋めにする「マスクド言語モデル」などで学習し、様々なNLPタスクで当時の最高精度を更新しました。

大規模言語モデル(LLM:Large Language Models)

数十億〜数千億パラメータを超える巨大なニューラルネットワークと、Web上の膨大なテキストデータを用いて学習された言語モデルのことです。
文章生成、翻訳、プログラミングコード作成など、非常に高い汎用能力を持っています。

PaLM

Googleが開発した5400億パラメータを持つ超大規模言語モデル(LLM)です。
パスウェイ(Pathways)と呼ばれる効率的なアーキテクチャを採用し、複雑な数学的推論やコード生成、ジョークの解説までこなす極めて高い能力を示しました。

GLUE

自然言語処理モデルの総合的な性能を評価するための標準的な「ベンチマーク(テスト集)」です。
質問応答や感情分析など複数のタスクが含まれており、モデルの汎用性能を数値で比較できます。


3. 【要点整理】特徴表現&Word2Vec比較まとめ

G検定で超頻出となる「言葉の数値化手法」と「Word2Vecの仕組み」を比較表で総整理します。

① テキストの数値化(特徴表現)の手法比較

手法名 意味の表現(類似度) 次元数 語順の考慮 特徴・弱点
ワンホットベクトル できない(すべて直交) 語彙数分(超巨大) なし シンプルだが「次元の呪い」が起きる
BoW 単語頻度のみ 語彙数分 なし 文章内の出現回数をカウント。語順は無視
TF-IDF 単語の重要度 語彙数分 なし 珍しい重要単語の重みを高く評価する
分散表現 (Word2Vec) できる(類似度計算可能) 低次元(数千以下) 文脈から学習 計算可能なベクトル。王-男+女=女王

② CBOW と スキップグラム の違い

モデル名 入力(与える情報) 出力(予測するもの) 特徴・メリット
CBOW 周囲の単語(文脈) 中央の単語 学習速度が速い。頻出語向け
スキップグラム 中央の単語 周囲の単語(文脈) レア(低頻度)な単語の精度が高い

③ 自然言語処理モデルの進化の流れ

時代 代表的手法・モデル 革新的なポイント
単語の数値化 BoW / TF-IDF 統計的な手法で単語の出現数や重要度を計算
分散表現の登場 Word2Vec / fastText 単語の意味をベクトル化(足し算・引き算が可能に)
時系列・翻訳 Seq2Seq / LSTM 可変長の文章を翻訳・生成可能にした
文脈依存・事前学習 ELMo / BERT 双方向の文脈を考慮した高精度な理解
超巨大化・生成 LLM(PaLMなど) 大規模データとパラメータで万能なテキスト生成を実現

4. G検定の「ひっかけ問題パターン」を総チェック!

実際の試験で選択肢の「言葉すり替え」として狙われやすいポイントです。

Q1. CBOWとスキップグラムに関する記述

  • ✕(誤り): CBOWは、中央の1単語を入力として受け取り、その周囲に存在する複数の単語(文脈)を予測するモデルである。
  • 〇(正しい): 中央の単語から周囲を予測するのは「スキップグラム」です。CBOWは「周囲の単語から中央の単語を予測」します。入力と出力が逆に作問されやすいので注意!

Q2. TF-IDFの計算式に関する記述

  • ✕(誤り): TF-IDFにおいて、あらゆる文書に共通して頻出する単語(「です」「ます」など)は、TF(単語頻度)の値が低くなるため重要度が下がると判定される。
  • 〇(正しい): 『です』『ます』のような全文書に頻出する単語は、IDF(逆文書頻度)の値が極端に低くなるため、結果としてTF-IDF全体の数値も小さくなり重要度が下がると判定されます

Q3. 単語の特徴表現に関する記述

  • ✕(誤り): ワンホットベクトルは、単語の意味の近さをベクトルの内積(コサイン類似度)によって正確に評価できるため、Word2Vecの代替として広く使われている。
  • 〇(正しい): ワンホットベクトル同士はすべて直交するため、内積は常に0になり「意味の近さを評価できません」。類似度を計算できるのは「分散表現(単語埋め込み)」です。

Q4. BERTの処理構造に関する記述

  • ✕(誤り): BERTは、文章を左から右へと一方向のみに読み込んで学習するため、文脈の後ろから前の単語への影響を考慮することができない。
  • 〇(正しい): BERTはTransformerのネットワークを使い、「左右の双方向から文脈を同時に考慮」して事前学習を行います。一方向処理の旧来モデルとの違いが問われます。

🔥 まとめ:言葉の「ベクトル化の歴史」を理解すればNLPは怖くない!

自然言語処理の学習で最も大切なのは、「コンピュータに言葉を教えるために、人類がどうやって数式(ベクトル)へ落とし込んできたか」というストーリーを理解することです。

ワンホットベクトルの限界からWord2Vecが生まれ、Seq2Seqで文章全体が扱えるようになり、BERTやLLMといった巨大モデルへと結実しました。
この流れと各キーワードの役割を押さえておけば、G検定のNLP問題は完璧です!

自信を持って次のステップへ進みましょう。応援しています!


【大人気💡】過去問風ミニテスト&関連テキスト

[「自然言語処理」]はバッチリ理解できましたか?
知識を確実に定着させて一発合格を引き寄せるために、今のあなたに最適なステップを選んで進んでみましょう!

合格率をグッと上げる!「過去問風ミニテスト」に挑戦

解説を読んだら、さっそく問題に挑戦して実力を確かめてみましょう!
ボタンをクリックするとミニテストのページが開きます。

🚀 最短ルートで合格を目指す!「厳選参考書」参考書をチョイス

G検定合格へのロードマップは、この一冊を机に置くことから始まります。まずは目次だけでもチェックしてみてください。

知識を『覚えたつもり』で終わらせない。この1冊を解き終える頃には、合格ライン突破に確実に近づきます。

関連項目の解説テキストを確認

【G検定対策】AttentionとTransformerを完全攻略!10の最重要キーワードの覚え方

G検定最頻出の「Attention(注意機構)」と「Transformer」を数式なしで徹底解説!Seq2Seqの限界から、クエリ・キー・バリューの仕組み、Self-Attention、Multi-Head Atte…

  • 【G検定対策】28. 音声処理(メル周波数ケプストラム係数やWaveNetを網羅)