【G検定過去問風テスト】Few-Shot学習が得意なVLM!Flamingoの仕組み

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

固定された巨大な言語モデル(LLM)と画像エンコーダの間にGated Cross-Attentionなどの結合層を差し込み、少数の例(画像とテキストのペア)を見せるだけで新しいタスクに適応できるFew-Shot学習を実現した、DeepMind社開発の視覚言語モデルとして、最も適切なものを1つ選べ。

  • A)CLIP
  • B)Flamingo
  • C)BLIP-2
  • D)GPT-4o
🔍 ここをクリックして正解を見る
  • 正解: B)Flamingo

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • Flamingoは、DeepMind社が開発した「Few-Shot学習」が得意な視覚言語モデル(VLM)。
  • 画像モデルとLLMの間に「Gated Cross-Attention」を挟むことで、少数の手本を示すだけで未知のタスクに柔軟に適応できる。

■ 初学者向け解説(例え話や背景)

Flamingoは、いわば「ほんの少し見本を見せただけで、職人技をすぐに真似して自分のものにしてしまう天才弟子」のような存在です。普通のAIはたくさん勉強しないと新しい作業ができませんが、Flamingoは「こういう画像と説明のセットがいくつかあるんだね」と数個の見本(Few-Shot)を提示されるだけで、すぐにコツをつかんで新しい問題にスラスラ対応できるようになります。


■ 選択肢の解説

  • A) CLIP(×): 4億ペアの画像とテキストを用いた対比学習により、Zero-Shot画像分類を実現したOpenAIのモデルです。
  • B) Flamingo(○): Gated Cross-Attentionを用い、少数の例(Few-Shot)だけで新しいタスクに適応できるDeepMind社のモデルです。正解です!
  • C) BLIP-2(×): 「Q-Former」という軽量な接続モジュールを用いて、固定された画像モデルとLLMを効率的に結びつけるフレームワークです。
  • D) GPT-4o(×): テキスト・音声・画像を単一のニューラルネットワークでネイティブに処理するオムニモデルです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?