【G検定過去問風テスト】オープンソースVLMの代表格!LLaVAの仕組み

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

Vision Transformer(ViT)で抽出した画像特徴量をシンプルな線形層で大規模言語モデル(LLM)に入力できるように接続し、GPT-4で生成した高品質な「画像と会話データ」を用いて命令チューニング(Instruction Tuning)を行った、オープンソースの視覚言語モデル(VLM)として、最も適切なものを1つ選べ。

  • A)CLIP
  • B)LLaVA
  • C)BLIP-2
  • D)Flamingo
🔍 ここをクリックして正解を見る
  • 正解: B)LLaVA

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • LLaVA(Large Language and Vision Assistant)は、オープンソースで公開されている代表的な視覚言語モデル(VLM)。
  • 画像を見る「ViT」と文章を考える「LLM(LLaMAなど)」をシンプルにつなぎ、GPT-4が作った高品質なデータで特訓(命令チューニング)しているのが特徴。

■ 初学者向け解説(例え話や背景)

LLaVA(ラヴァ)は、いわば「無償で公開されている、目と脳を持った優等生アシスタント」です。画像を認識する「目(ViT)」と、文章を操る「脳(LLM)」をシンプルなパイプでつなぎ合わせています。さらに、超優秀な「GPT-4先生」が作った「画像を使った賢い会話のお手本」をたくさん読み込ませて特訓したことで、オープンソースでありながら非常に賢く画像について対話できるAIに仕上がっています。


■ 選択肢の解説

  • A) CLIP(×): 画像とテキストを対比学習させ、Zero-Shot画像分類などを実現したOpenAIのモデルです。
  • B) LLaVA(○): ViTとLLMを接続し、GPT-4のデータで命令チューニングを行ったオープンソースのVLMです。正解です!
  • C) BLIP-2(×): 「Q-Former」という軽量な接続モジュールを用いて、固定された巨大な画像モデルとLLMを効率的につなぐフレームワークです。
  • D) Flamingo(×): Gated Cross-Attentionを用い、少数の例(Few-Shot)で新しいタスクに適応するDeepMind社のモデルです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?