【G検定過去問風テスト】画像と対話する!VQAの仕組みと特徴
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
提示された画像と、その画像に関する自然言語の質問(例:「テーブルの上にりんごは何個ありますか?」)を入力し、AIが正確な答えをテキストで返すマルチモーダルタスクとして、最も適切なものを1つ選べ。
- A)VQA(Visual Question Answering)
- B)Image Captioning
- C)Text-to-Image
- D)Zero-Shot画像分類
🔍 ここをクリックして正解を見る
- 正解: A)VQA(Visual Question Answering)
💡 合格に近づく!徹底解説
- 重要度: ★★☆
■ 1分で分かる!この問題の要点
- VQA(Visual Question Answering): 「画像」と「テキストの質問」をセットで入力し、AIが「テキスト」で答えを返すタスク。
- 画像全体の説明文を作る「Image Captioning」など他の応用タスクとの違いを混同しないように注意する。
■ 初学者向け解説(例え話や背景)
VQAは、いわば「絵本を見せながら『この動物の名前は何?』と子供に質問し、子供が言葉で答えてくれるようなやり取り」そのものです。AI技術の応用が進み、ただ写真を見るだけでなく、「この写真の看板には何と書いてある?」「危ない障害物はどこにある?」といった具体的な質問に対して、AIが画像の中身を理解して的確に文字で答えてくれる仕組みとして、様々なサービスで活用されています。
■ 選択肢の解説
- A) VQA(Visual Question Answering)(○): 画像とテキストの質問を入力し、テキストで回答を返すタスクです。正解です!
- B) Image Captioning(×): 入力された画像の内容を読み取り、状況を説明する文章(キャプション)を自動生成するタスクです。
- C) Text-to-Image(×): テキストの指示文(プロンプト)を入力し、それに合致した新しい画像を生成するタスクです。
- D) Zero-Shot画像分類(×): 事前の個別学習なしに、未知の画像クラスを高精度に分類する機械学習の手法です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
