【G検定過去問風テスト】マルチモーダルの金字塔!CLIPの仕組みを完全解説

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

インターネット上の膨大な「画像とテキスト(キャプション)のペア」を用いて対比学習を行い、事前学習だけで未知の画像分類タスクを高精度に行える「Zero-Shot画像分類」を実現したモデルとして、最も適切なものを1つ選べ。

  • A)CLIP
  • B)Flamingo
  • C)BLIP-2
  • D)GPT-4o
🔍 ここをクリックして正解を見る
  • 正解: A)CLIP

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • CLIPは、画像とテキストを「対比学習」で同じ空間(共有埋め込み空間)に配置するモデル。
  • 事前学習なしで未知の画像を分類できる「Zero-Shot画像分類」が最大の特徴。

■ 初学者向け解説(例え話や背景)

CLIPは、いわば「絵と言葉の辞書」を完璧にマスターした通訳士のような存在です。これまでAIは「画像だけ」「テキストだけ」と別々に学ぶのが主流でしたが、CLIPは「この写真は『犬』という単語にぴったりだね」というペアの関係性を大量のデータから学びました。その結果、新しい写真を見せられたとき、特別に教え込まれなくても「これは〇〇の画像だな」とパッと判断できるようになりました(これがZero-Shot画像分類です)。


■ 選択肢の解説

  • A) CLIP(○): 4億ペアの画像とテキストを用いた対比学習により、Zero-Shot画像分類を実現したOpenAIのモデルです。正解です!
  • B) Flamingo(×): 少数の例(Few-Shot)で新しいタスクに適応する、DeepMind社の強力な視覚言語モデル(VLM)です。
  • C) BLIP-2(×): 「Q-Former」という軽量な接続モジュールを用いて、固定された画像モデルとLLMを効率的に結びつけるフレームワークです。
  • D) GPT-4o(×): テキスト・音声・画像を単一のニューラルネットワークでネイティブに処理するオムニモデルです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?