【G検定過去問風テスト】共通の空間で結ぶ!共有埋め込み空間の仕組み

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

テキストや画像など、異なるモダリティのデータを同じ次元のベクトル表現(数値の並び)に変換して配置する共通の空間であり、例えば「猫の画像」ベクトルとクル「"a photo of a cat"という文章」ベクトルが近い位置に配置されるように学習される仕組みとして、最も適切なものを1つ選べ。

  • A)共有埋め込み空間(Shared Embedding Space)
  • B)Gated Cross-Attention
  • C)Q-Former
  • D)早期統合(Early Fusion)
🔍 ここをクリックして正解を見る
  • 正解: A)共有埋め込み空間(Shared Embedding Space)

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • 共有埋め込み空間は、異なる種類のデータ(画像と文字など)を「同じ意味のマップ(空間)」上で近くに配置するための仕組み。
  • CLIPなどのモデルにおいて、画像とテキストの意味を結びつける土台となっている。

■ 初学者向け解説(例え話や背景)

日本語の「りんご」という言葉と、英語の「apple」、そして本物の赤いりんごの写真。これらは形も文字もバラバラですが、人間の頭の中ではすべて同じ「あの赤い果物」として結びついていますよね。AIにとっても同様で、異なる言語や画像を「意味が同じなら近くに集まるような、共通の世界地図(空間)」に変換して整理してあげることで、お互いの関係を正しく理解できるようになります。


■ 選択肢の解説

  • A) 共有埋め込み空間(Shared Embedding Space)(○): 異なるモダリティを同じ次元のベクトル空間に配置し、意味の近いものを近くに並べる仕組みです。正解です!
  • B) Gated Cross-Attention(×): Flamingoなどで使われる、画像モデルとLLMの間でアテンションを計算・制御する結合層の仕組みです。
  • C) Q-Former(×): BLIP-2などで使われる、固定された画像モデルとLLMの間をつなぐ軽量な接続モジュールです。
  • D) 早期統合(Early Fusion)(×): 入力や初期の特徴量の段階で複数モダリティのデータを結合する設計手法です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?