【G検定過去問風テスト】異種データをつなぐ!Cross-Attentionの仕組み

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

Transformer構造において、画像の情報とテキストの情報のように異なるモダリティ同士でアテンション(注目度)を動的に計算し、文章中の単語が画像のどのエリアを指しているかを結びつける機構として、最も適切なものを1つ選べ。

  • A)Self-Attention
  • B)Cross-Attention
  • C)Contrastive Learning
  • D)Instruction Tuning
🔍 ここをクリックして正解を見る
  • 正解: B)Cross-Attention

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • Cross-Attentionは、「異なるモダリティ(画像とテキストなど)の間」で注目度を計算する仕組み。
  • 単一のデータ内を見る「Self-Attention」との違いを区別できるようにしておくことがポイント。

■ 初学者向け解説(例え話や背景)

Cross-Attentionは、いわば「お母さんが絵本に描かれている絵と文章(単語)結び付けて教えてあげるようなもの」です。「赤いリンゴ」という言葉を聞いたとき、画像のどこがリンゴなのかを矢印で結ぶように、異なる種類の情報同士を橋渡しして結びつける重要な役割を持っています。


■ 選択肢の解説

  • A) Self-Attention(×): 単一のデータ(文章の中の単語同士など)の中で、お互いの関連度を計算する機構です。
  • B) Cross-Attention(○): 画像とテキストなど、異なるモダリティの間でアテンションを計算する仕組みです。正解です!
  • C) Contrastive Learning(×): 正しいペアのベクトルを近づけ、無関係なペアを遠ざけるように学習する「対比学習」のことです。
  • D) Instruction Tuning(×): AIに具体的な指示(プロンプト)と回答のセットを学習させ、対話能力を高める手法です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?