【G検定過去問風テスト】Transformerの肝「位置エンコーディング」の目的を完全攻略!
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
Transformerモデルは、文章中の単語をRNNのように順番に処理するのではなく、一斉に並列処理するという特徴を持っています。そのためそのままでは単語の順番(前後関係)が失われてしまいますが、これを補うために単語のベクトルに足し合わされる技術として、最も適切な選択肢を1つ選べ。
- A)位置エンコーディング (Positional Encoding)
- B)スケーリング則
- C)パディング
- D)グローバルアベレージプーリング (GAP)
🔍 ここをクリックして正解を見る
- 正解: ○)A)位置エンコーディング (Positional Encoding)
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- Transformerはすべての単語を「並列処理」するため、高速な学習が可能。
- 一方で、並列処理をするがゆえに「単語の並び順(文脈)」が分からなくなるという弱点がある。
- その弱点を補うために、単語の位置情報を表す数値を足し合わせる仕組みが「位置エンコーディング」である。
■ 初学者向け解説(例え話や背景)
「犬が人を噛んだ」と「人が犬を噛んだ」は、使われている単語は全く同じですが、意味は180度違いますよね。これを見分けるために重要なのが「言葉の並び順(位置情報)」です。
従来のRNNは、電車が1車両ずつ順番に駅を通るように単語を1つずつ処理していたため、自然と順番を認識できました。しかし、新世代のTransformerは、すべての車両(単語)を同時に一斉発進させるような「並列処理」を行います。これによって圧倒的なスピードを手に入れたものの、「どの単語が先頭で、どれが後ろだったか」という名札が外れてしまいました。
そこで、「この単語は〇番目だよ」という位置情報のハンコ(ベクトル)をそれぞれの単語にペタッと押し直してあげる作業が、位置エンコーディング(Positional Encoding)の役割です!試験ではその「目的」がよく問われますので、セットでしっかり押さえておきましょう。
■ 選択肢の解説
- A) 位置エンコーディング (Positional Encoding)(○): Transformerにおいて、並列処理によって失われる単語の並び順(位置情報)を補うための技術であり、正解です。
- B) スケーリング則(×): 大規模なデータセットや計算資源を用いることで、モデルの性能が予測可能な形で向上する関係性のことを指します。GPTなどの大規模化の前提となる法則です。
- C) パディング(×): 畳み込みニューラルネットワーク(CNN)などで出力サイズを調整したり、可変長のテキストデータをそろえるために「余白」を埋める処理のことです。
- D) グローバルアベレージプーリング (GAP)(×): CNNの出力層において、全結合層の代わりに特徴マップ全体の平均値を計算し、解釈性を高めるために用いられる手法です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?

