【G検定過去問風テスト】TF-IDFの仕組みと計算のポイントを完全マスター
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
文章中の単語の重要度を評価する指標である「TF-IDF」に関する説明として、最も適切な選択肢を1つ選べ。
- A)TF-IDFは、特定の文章に頻出する単語の評価を高くしつつ、あらゆる文書に共通して当たり前に頻出する一般的な単語の評価を下げる計算を行う。
- B)TF-IDFは、文章中の単語の並び順(語順)を完全に保持してベクトル化する手法である。
- C)TF-IDFにおいて、全文書に共通して頻出する「です」「ます」などの言葉は、IDFの値が極端に高くなるため、結果として重要度が非常に高くなる。
- D)TF-IDFは、ワンホットベクトルと同様に、単語の意味の近さや類推演算(足し算・引き算)を行うことができる。
🔍 ここをクリックして正解を見る
- 正解: A)TF-IDFは、特定の文章に頻出する単語の評価を高くしつつ、あらゆる文書に共通して当たり前に頻出する一般的な単語の評価を下げる計算を行う。
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- TF(単語頻度)は「ある文章の中でたくさん出てくる言葉」の評価を上げる。
- IDF(逆文書頻度)は「どの文書にも当たり前に出てくる一般的な言葉」の評価を下げる。
- この2つを掛け合わせたTF-IDFは、「その文書にとって本当に重要なキーワード」を見つけ出す指標。
■ 初学者向け解説(例え話や背景)
膨大なニュース記事やWebサイトの中から、「この記事は何について書かれているか(重要キーワード)」を見つけ出したいとき、どうすればよいでしょうか?
もし単純に「出現回数が多い言葉」だけで選んでしまうと、「の」「です」「ます」「これ」といった、どの記事にも必ず大量に出てくるありふれた言葉ばかりが選ばれてしまいますよね。これでは記事のテーマが分かりません。
そこで登場するのがTF-IDFです!
イメージとしては、「ニュース番組で、ありふれた言葉(です・ます等)はスルーしつつ、その日のニュースに特有の珍しい専門用語(例:『半導体』や『AI』など)をスクープのキーワードとして際立たせる編集長」のようなものです。
- TF(Term Frequency:単語頻度): その記事の中で、その言葉がどれだけたくさん使われているか(多いほど重要)。
- IDF(Inverse Document Frequency:逆文書頻度): 世の中のたくさんの記事のうち、どれくらい珍しい言葉か(珍しいほど重要)。
この2つを掛け合わせることで、「その記事ならではの重要なキーワード」を正確にあぶり出すことができます。G検定では仕組みやひっかけ表現が狙われやすいので、しっかり押さえておきましょう!
■ 選択肢の解説
- A)(○): TF-IDFに関する正しい説明です。特定記事での出現頻度を評価しつつ、全文書に共通するありふれた単語の重要度を引き下げます。本問の正解です。
- B)(×): TF-IDFは単語の出現頻度や文書の統計量をベースにするため、単語の並び順(語順)は考慮されません(BoWの仕組みがベースになっています)。
- C)(×): 全文書に共通して頻出する「です」「ます」などは、逆文書頻度(IDF)の値が極端に低くなるため、結果としてTF-IDF全体の数値も小さくなり重要度が下がります。「高くなる」とあるため誤りです。
- D)(×): TF-IDFは統計的な重要度を測る指標であり、単語の意味の近さやベクトル演算を行うことができるのは(Word2Vecなどの)分散表現です。ワンホットベクトルやTF-IDFでは、そうした意味の近さや類推演算を行うことはできません。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
