【G検定過去問風テスト】写真の説明文を自動生成!Image Captioningの仕組み

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

入力された画像の内容を読み取り、その状況や状況説明を行う自然言語の文章(例:「公園のベンチで犬と遊んでいる男の子」)を自動生成するマルチモーダルタスクとして、最も適切なものを1つ選べ。

  • A)Image Captioning
  • B)VQA(Visual Question Answering)
  • C)Text-to-Image
  • D)Zero-Shot画像分類
🔍 ここをクリックして正解を見る
  • 正解: A)Image Captioning

💡 合格に近づく!徹底解説

  • 重要度: ★★☆

■ 1分で分かる!この問題の要点

  • Image Captioning(画像キャプション生成): 「画像」を入力すると、AIがその写真の状況を説明する「文章」を自動で書き下ろすタスク。
  • 人間に質問されたことに答える「VQA」とは異なり、指示なしで写真の説明文そのものを出力するのが特徴。

■ 初学者向け解説(例え話や背景)

Image Captioningは、いわば「観光地で写真をとったとき、アルバムの脇に『美しい夕日を背景に海岸を散歩するカップル』と情緒豊かな説明書きをそっと添えてくれる几帳面なアルバム係」のようなものです。画像(視覚)の情報をまるごと受け取り、それを人間が読んでスッと情景が目に浮かぶような自然な文章(テキスト)へと変換して出力する、マルチモーダルの基本かつ重要な応用技術です。


■ 選択肢の解説

  • A) Image Captioning(画像キャプション生成)(○): 入力された画像の説明文(キャプション)を自動生成するタスクです。正解です!
  • B) VQA(×): 画像とテキストの「質問」をセットで入力し、質問に対する答えをテキストで返すタスクです。
  • C) Text-to-Image(×): テキストの指示文を入力し、それに合致した新しい画像を生成するタスクです。
  • D) Zero-Shot画像分類(×): 事前の個別学習なしに、未知の画像クラスを高精度に分類する機械学習の手法です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?