【G検定対策】自然言語処理(NLP)の最重要キーワード25選!Word2VecからLLM・BERTまで完全解説

※本記事では、アフィリエイトプログラムより教材を紹介しています。
【重要度】★★★
G検定の「自然言語処理(NLP)」分野は、専門用語やアルファベット表記のモデル名(Word2Vec, BERT, LLMなど)が非常に多く、受験生が混同しやすい難所の一つです。
「ワンホットベクトルと分散表現って何が違うの?」「CBOWとスキップグラムの違いが覚えられない…」と悩んでいませんか?
ご安心ください!この記事では、単語を数値化する歴史的背景から最新の大規模言語モデル(LLM)まで、G検定で理解が必要となるキーワードを身近な「例え話」で分かりやすく整理しました。
試験で狙われやすい「ひっかけパターン」や要点比較表も掲載しているので、最後まで読めばNLP分野が得点源に変わりますよ!
1. 自然言語処理(NLP)とは?分かりやすい例え話で解説
自然言語処理(NLP:Natural Language Processing)とは、私たちが普段話したり書いたりしている「言葉(自然言語)」を、コンピュータに理解・処理させる技術のことです。
コンピュータは数字しか計算できないため、人間が書いた文章をそのまま理解することはできません。
そのため、自然言語処理の本質は「いかに意味を保ったまま言葉を数字(ベクトル)に変換し、AIに計算させるか」にあります。
自然言語処理の仕組みは、言ってみれば「超優秀な外国人の翻訳秘書」のようなものです。
秘書は、日本語の文章をそのまま読むのではなく、一度「自分だけの意味数値マップ」に変換して整理します。
その数値マップをもとに、文章の要約を作成したり、感情を分析したり、別の言語へ正確に翻訳したりするイメージです。
G検定では、「単語をどう数値化してきたか(特徴表現)」の歴史と、「言葉を処理するモデル」の進化プロセスが頻出されます。
それでは、基本となるタスクとキーワードを順番に見ていきましょう!
2. 試験に出る!最重要キーワードの解説と覚え方
シラバスに登場するキーワードを、「NLPの処理プロセス・応用タスク」「特徴表現(ベクトル化)」「Word2Vecと発展モデル」「時系列・最新モデル(LLM)」の4つのグループに分けて詳しく解説します。
【NLPの処理プロセスと応用タスク】文章を分解して処理する
テキストデータをコンピュータで扱う際、段階を踏んで解析が行われます。
形態素解析
意味を持つ最小の単位である「形態素(けいたいそ)」に文章を分割し、それぞれの品詞を特定する作業です。
例えば、「すもももももももものうち」を「すもも / も / もも / も / もも / の / うち」と切り分ける処理のことです。
構文解析
形態素解析で分けた単語同士の「主語と述語の関係」や「修飾・被修飾の関係」といった文法的な構造(係り受け関係)を解析する技術です。
機械翻訳 / 統計的機械翻訳
ある言語の文章を別の言語に自動変換する技術です。
初期の「ルールベース機械翻訳」から、膨大な双訳データから確率計算で最適な訳を導く「統計的機械翻訳」へ進化し、現在はディープラーニングを用いた「ニューラル機械翻訳(NMT)」が主流となっています。
感情分析
口コミやSNSの投稿テキストから、「ネガティブ(批判的)」「ポジティブ(好意的)」「中立」などの感情や評価を自動で分類・検出するタスクです。
文書要約
長い文章の重要なポイントを抽出し、短く簡潔な要約文を自動生成するタスクです。
質問応答
「日本の首都は?」という人間の質問に対して、知識データベースやWeb上の情報から的確な答え(「東京です」)を検索・生成して返す技術です。
情報検索
ユーザーが入力した検索キーワードに対して、膨大なデータベースの中から最も関連性の高い文書やウェブページを探し出して表示するシステムです(Google検索など)。
【特徴表現・ベクトル化】言葉を「数字」に変換する手法
言葉をコンピュータに理解させるため、単語や文章を数値(ベクトル)に変換する手法の歴史です。
ワンホットベクトル(One-hot Vector)
単語を「1」と「0」の列で表現する最もシンプルな方法です。
語彙数が10,000語ある場合、該当する単語の要素だけを「1」、それ以外をすべて「0」にした10,000次元のベクトルを作ります。
単語が増えると「次元の呪い」が起きる上、「単語同士の意味の近さ(例:犬と猫は似ている等)」を表現できないという致命的な欠点があります。
BoW(Bag-of-Words)
文章中に「どの単語が何回出現したか」をカウントして文章をベクトル化する手法です。
「袋(Bag)の中に単語を放り込んだ」ように扱うため、単語の並び順(語順)が無視されるという特徴があります。
n-gram
連続するn個の単語(または文字)のまとまりを単位にしてテキストを解析する手法です。
1個ならユニグラム(Unigram)、2個ならバイグラム(Bigram)、3個ならトライグラム(Trigram)と呼びます。
語順の情報をある程度保持できるメリットがあります。
TF-IDF
文章中の単語の重要度を計算する指標です。
「特定の文章によく出る単語(TF:単語頻度)」を高く評価しつつ、「どの文章にも当たり前に出る一般的な単語(IDF:逆文書頻度)」の評価を下げる計算を行います。
例えば、「AI」という言葉が特定の記事に多ければ重要視されますが、「これ」「です」のような言葉は全記事に出るため重要度が下げられます。
分散表現 / 単語埋め込み(Word Embedding)
単語を数十〜数百次元程度の「高次元の連続値(少数)」のベクトルで表現する手法です。
ワンホットベクトルと違い、高次元空間に単語を配置することで、「単語の意味の近さや関係性」を表現可能にしました。
ベクトル演算により「王 - 男性 + 女性 = 女王」のような単語の意味の足し算・引き算ができるのが最大の特徴です。
【Word2Vecと発展モデル】単語の意味を学習する
分散表現を飛躍的に広めた代表的な手法が「Word2Vec」です。
Word2vec
2013年にトマス・ミコロフ氏らが提案した、ニューラルネットワークを用いて単語の分散表現を効率的に学習する手法です。
後述する「CBOW」と「スキップグラム」という2つのモデル構造を持ちます。
CBOW(Continuous Bag-of-Words)
Word2Vecの学習モデルの一つで、「周囲の単語(文脈)から、中央の単語(ターゲット)を予測する」手法です。
計算速度が速い、頻出語の扱いに長けています。
スキップグラム(Skip-gram)
Word2Vecのもう一つのモデルで、CBOWとは逆に「中央の単語(ターゲット)から、周囲の単語(文脈)を予測する」手法です。
CBOWよりも計算量は多いですが、低頻度(レア)な単語でも高精度なベクトルを作成できます。
fastText
Facebook(現Meta)が開発したWord2Vecの拡張モデルです。
単語をさらに細かい「文字単位のn-gram(サブワード)」に分解して学習するため、「辞書にない未知の単語(OOV:Out-of-Vocabulary)」に対しても分散表現を生成できるのが強みです。
【時系列モデルからLLMへ】文脈を捉える最新AIの進化
単語単体だけでなく、文脈全体や大量のテキストを扱うモデルへと進化しました。
Seq2Seq
Encoder(入力文をベクトルに圧縮)とDecoder(ベクトルから出力文を生成)の2つのRNNを組み合わせたモデルです。
機械翻訳や文章要約など、「入力の長さと出力の長さが異なるタスク」を可能にしました。
CEC(Constant Error Carousel)
LSTM(Long Short-Term Memory)の内部にある、誤差を減衰させずに過去へ伝え続ける誤差カルーセル(CEC)と呼ばれる仕組みのことです。
勾配を減衰させずに過去の情報を保持し続けることで、RNNの弱点だった「勾配消失問題」を解決しました。
ELMo(Embeddings from Language Models)
双方向LSTMを用いて、「文脈によって意味が変わる単語」を適切にベクトル化(文脈依存の単語埋め込み)できるようにしたモデルです。
例えば、「銀行(Bank)」と「川の岸(Bank)」のような同音異義語を文脈に応じて正しく区別できます。
BERT
TransformerのEncoder部分を利用し、大量のテキストから「事前学習(Self-Attentionによる双方向処理)」を行った画期的なモデルです。
文章の一部を穴埋めにする「マスクド言語モデル」などで学習し、様々なNLPタスクで当時の最高精度を更新しました。
大規模言語モデル(LLM:Large Language Models)
数十億〜数千億パラメータを超える巨大なニューラルネットワークと、Web上の膨大なテキストデータを用いて学習された言語モデルのことです。
文章生成、翻訳、プログラミングコード作成など、非常に高い汎用能力を持っています。
PaLM
Googleが開発した5400億パラメータを持つ超大規模言語モデル(LLM)です。
パスウェイ(Pathways)と呼ばれる効率的なアーキテクチャを採用し、複雑な数学的推論やコード生成、ジョークの解説までこなす極めて高い能力を示しました。
GLUE
自然言語処理モデルの総合的な性能を評価するための標準的な「ベンチマーク(テスト集)」です。
質問応答や感情分析など複数のタスクが含まれており、モデルの汎用性能を数値で比較できます。
3. 【要点整理】特徴表現&Word2Vec比較まとめ
G検定で超頻出となる「言葉の数値化手法」と「Word2Vecの仕組み」を比較表で総整理します。
① テキストの数値化(特徴表現)の手法比較
| 手法名 | 意味の表現(類似度) | 次元数 | 語順の考慮 | 特徴・弱点 |
|---|---|---|---|---|
| ワンホットベクトル | できない(すべて直交) | 語彙数分(超巨大) | なし | シンプルだが「次元の呪い」が起きる |
| BoW | 単語頻度のみ | 語彙数分 | なし | 文章内の出現回数をカウント。語順は無視 |
| TF-IDF | 単語の重要度 | 語彙数分 | なし | 珍しい重要単語の重みを高く評価する |
| 分散表現 (Word2Vec) | できる(類似度計算可能) | 低次元(数千以下) | 文脈から学習 | 計算可能なベクトル。王-男+女=女王 |
② CBOW と スキップグラム の違い
| モデル名 | 入力(与える情報) | 出力(予測するもの) | 特徴・メリット |
|---|---|---|---|
| CBOW | 周囲の単語(文脈) | 中央の単語 | 学習速度が速い。頻出語向け |
| スキップグラム | 中央の単語 | 周囲の単語(文脈) | レア(低頻度)な単語の精度が高い |
③ 自然言語処理モデルの進化の流れ
| 時代 | 代表的手法・モデル | 革新的なポイント |
|---|---|---|
| 単語の数値化 | BoW / TF-IDF | 統計的な手法で単語の出現数や重要度を計算 |
| 分散表現の登場 | Word2Vec / fastText | 単語の意味をベクトル化(足し算・引き算が可能に) |
| 時系列・翻訳 | Seq2Seq / LSTM | 可変長の文章を翻訳・生成可能にした |
| 文脈依存・事前学習 | ELMo / BERT | 双方向の文脈を考慮した高精度な理解 |
| 超巨大化・生成 | LLM(PaLMなど) | 大規模データとパラメータで万能なテキスト生成を実現 |
4. G検定の「ひっかけ問題パターン」を総チェック!
実際の試験で選択肢の「言葉すり替え」として狙われやすいポイントです。
Q1. CBOWとスキップグラムに関する記述
- ✕(誤り): CBOWは、中央の1単語を入力として受け取り、その周囲に存在する複数の単語(文脈)を予測するモデルである。
- 〇(正しい): 中央の単語から周囲を予測するのは「スキップグラム」です。CBOWは「周囲の単語から中央の単語を予測」します。入力と出力が逆に作問されやすいので注意!
Q2. TF-IDFの計算式に関する記述
- ✕(誤り): TF-IDFにおいて、あらゆる文書に共通して頻出する単語(「です」「ます」など)は、TF(単語頻度)の値が低くなるため重要度が下がると判定される。
- 〇(正しい): 『です』『ます』のような全文書に頻出する単語は、IDF(逆文書頻度)の値が極端に低くなるため、結果としてTF-IDF全体の数値も小さくなり重要度が下がると判定されます
Q3. 単語の特徴表現に関する記述
- ✕(誤り): ワンホットベクトルは、単語の意味の近さをベクトルの内積(コサイン類似度)によって正確に評価できるため、Word2Vecの代替として広く使われている。
- 〇(正しい): ワンホットベクトル同士はすべて直交するため、内積は常に0になり「意味の近さを評価できません」。類似度を計算できるのは「分散表現(単語埋め込み)」です。
Q4. BERTの処理構造に関する記述
- ✕(誤り): BERTは、文章を左から右へと一方向のみに読み込んで学習するため、文脈の後ろから前の単語への影響を考慮することができない。
- 〇(正しい): BERTはTransformerのネットワークを使い、「左右の双方向から文脈を同時に考慮」して事前学習を行います。一方向処理の旧来モデルとの違いが問われます。
🔥 まとめ:言葉の「ベクトル化の歴史」を理解すればNLPは怖くない!
自然言語処理の学習で最も大切なのは、「コンピュータに言葉を教えるために、人類がどうやって数式(ベクトル)へ落とし込んできたか」というストーリーを理解することです。
ワンホットベクトルの限界からWord2Vecが生まれ、Seq2Seqで文章全体が扱えるようになり、BERTやLLMといった巨大モデルへと結実しました。
この流れと各キーワードの役割を押さえておけば、G検定のNLP問題は完璧です!
自信を持って次のステップへ進みましょう。応援しています!
【大人気💡】過去問風ミニテスト&関連テキスト
[「自然言語処理」]はバッチリ理解できましたか?
知識を確実に定着させて一発合格を引き寄せるために、今のあなたに最適なステップを選んで進んでみましょう!
合格率をグッと上げる!「過去問風ミニテスト」に挑戦
解説を読んだら、さっそく問題に挑戦して実力を確かめてみましょう!
ボタンをクリックするとミニテストのページが開きます。
🚀 最短ルートで合格を目指す!「厳選参考書」参考書をチョイス
G検定合格へのロードマップは、この一冊を机に置くことから始まります。まずは目次だけでもチェックしてみてください。
知識を『覚えたつもり』で終わらせない。この1冊を解き終える頃には、合格ライン突破に確実に近づきます。
関連項目の解説テキストを確認
- 【G検定対策】28. 音声処理(メル周波数ケプストラム係数やWaveNetを網羅)
