【G検定過去問風テスト】並列化で精度を高める「Multi-Head Attention」の仕組み
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
Transformerモデルにおいて、Attentionの計算を独立した複数のルート(ヘッド)で同時に並列して行い、異なる複数の視点から文章の文脈を捉える仕組みとして、最も適切な選択肢を1つ選べ。
- A)Multi-Head Attention
- B)位置エンコーディング
- C)パディング
- D)グローバルアベレージプーリング (GAP)
🔍 ここをクリックして正解を見る
- 正解: ○)A)Multi-Head Attention
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- Attentionの計算を1つだけでなく、複数の「ヘッド(視点)」で同時に並列して行うのが「Multi-Head Attention」。
- 「文法的な関係」「意味的な関係」「指示語のつながり」など、多様な角度から同時に文章を分析できる。
- Transformerの表現力を飛躍的に高める中心的な仕組みの一つ。
■ 初学者向け解説(例え話や背景)
1つの事件を捜査するとき、刑事1人だけで調べるよりも、複数の刑事(例えば、足跡の専門家、目撃証言の専門家、動機の専門家など)が同時に異なる視点から捜査したほうが、事件の真相に早くたどり着けますよね。
Multi-Head Attentionは、まさにこれと同じアプローチです。Attentionを「複数のヘッド(頭脳・視点)」に増やし、文法的なつながりを見るヘッド、主語と述語の関係を見るヘッド、代名詞の指すものを見るヘッドなどを同時に並列して動かします。これにより、単一の視点では見落としてしまうような複雑な文脈も、多角的に深く捉えることができるようになります。試験では「並列」「複数の視点・ヘッド」というキーワードが大きな目印になります!
■ 選択肢の解説
- A) Multi-Head Attention(○): 複数の独立したヘッドでAttentionの計算を同時に並列して行う仕組みであり、正解です。
- B) 位置エンコーディング(×): Transformerにおいて、並列処理によって失われる単語の並び順(位置情報)を補うための技術です。
- C) パディング(×): CNN等で出力サイズを調整したり、可変長のテキストデータをそろえるために余白を埋める処理のことです。
- D) グローバルアベレージプーリング (GAP)(×): CNNの出力層で、全結合層の代わりに特徴マップ全体の平均値を計算し、解釈性を高める手法です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
