【G検定過去問風テスト】マルチモーダルの金字塔!CLIPの仕組みを完全解説
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
インターネット上の膨大な「画像とテキスト(キャプション)のペア」を用いて対比学習を行い、事前学習だけで未知の画像分類タスクを高精度に行える「Zero-Shot画像分類」を実現したモデルとして、最も適切なものを1つ選べ。
- A)CLIP
- B)Flamingo
- C)BLIP-2
- D)GPT-4o
🔍 ここをクリックして正解を見る
- 正解: A)CLIP
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- CLIPは、画像とテキストを「対比学習」で同じ空間(共有埋め込み空間)に配置するモデル。
- 事前学習なしで未知の画像を分類できる「Zero-Shot画像分類」が最大の特徴。
■ 初学者向け解説(例え話や背景)
CLIPは、いわば「絵と言葉の辞書」を完璧にマスターした通訳士のような存在です。これまでAIは「画像だけ」「テキストだけ」と別々に学ぶのが主流でしたが、CLIPは「この写真は『犬』という単語にぴったりだね」というペアの関係性を大量のデータから学びました。その結果、新しい写真を見せられたとき、特別に教え込まれなくても「これは〇〇の画像だな」とパッと判断できるようになりました(これがZero-Shot画像分類です)。
■ 選択肢の解説
- A) CLIP(○): 4億ペアの画像とテキストを用いた対比学習により、Zero-Shot画像分類を実現したOpenAIのモデルです。正解です!
- B) Flamingo(×): 少数の例(Few-Shot)で新しいタスクに適応する、DeepMind社の強力な視覚言語モデル(VLM)です。
- C) BLIP-2(×): 「Q-Former」という軽量な接続モジュールを用いて、固定された画像モデルとLLMを効率的に結びつけるフレームワークです。
- D) GPT-4o(×): テキスト・音声・画像を単一のニューラルネットワークでネイティブに処理するオムニモデルです。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?

