【G検定過去問風テスト】画像と対話する!VQAの仕組みと特徴

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

提示された画像と、その画像に関する自然言語の質問(例:「テーブルの上にりんごは何個ありますか?」)を入力し、AIが正確な答えをテキストで返すマルチモーダルタスクとして、最も適切なものを1つ選べ。

  • A)VQA(Visual Question Answering)
  • B)Image Captioning
  • C)Text-to-Image
  • D)Zero-Shot画像分類
🔍 ここをクリックして正解を見る
  • 正解: A)VQA(Visual Question Answering)

💡 合格に近づく!徹底解説

  • 重要度: ★★☆

■ 1分で分かる!この問題の要点

  • VQA(Visual Question Answering): 「画像」と「テキストの質問」をセットで入力し、AIが「テキスト」で答えを返すタスク。
  • 画像全体の説明文を作る「Image Captioning」など他の応用タスクとの違いを混同しないように注意する。

■ 初学者向け解説(例え話や背景)

VQAは、いわば「絵本を見せながら『この動物の名前は何?』と子供に質問し、子供が言葉で答えてくれるようなやり取り」そのものです。AI技術の応用が進み、ただ写真を見るだけでなく、「この写真の看板には何と書いてある?」「危ない障害物はどこにある?」といった具体的な質問に対して、AIが画像の中身を理解して的確に文字で答えてくれる仕組みとして、様々なサービスで活用されています。


■ 選択肢の解説

  • A) VQA(Visual Question Answering)(○): 画像とテキストの質問を入力し、テキストで回答を返すタスクです。正解です!
  • B) Image Captioning(×): 入力された画像の内容を読み取り、状況を説明する文章(キャプション)を自動生成するタスクです。
  • C) Text-to-Image(×): テキストの指示文(プロンプト)を入力し、それに合致した新しい画像を生成するタスクです。
  • D) Zero-Shot画像分類(×): 事前の個別学習なしに、未知の画像クラスを高精度に分類する機械学習の手法です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?