【G検定過去問風テスト】言葉から絵を描き出す!Text-to-Imageの仕組み

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

プロンプト(テキストの指示文)を入力すると、その内容に合致した新しい画像をAIが生成するマルチモーダル関連のタスクとして、最も適切なものを1つ選べ。

  • A)Text-to-Image
  • B)Image Captioning
  • C)VQA(Visual Question Answering)
  • D)Zero-Shot画像分類
🔍 ここをクリックして正解を見る
  • 正解: A)Text-to-Image

💡 合格に近づく!徹底解説

  • 重要度: ★★☆

■ 1分で分かる!この問題の要点

  • Text-to-Image(テキスト画像生成): 「テキスト(言葉の指示)」を入力すると、AIがゼロから「画像」を作り出すタスク。
  • MidjourneyやStable Diffusionなどが代表例で、背景にはCLIPなどの言語・画像共有空間の技術が活用されている。

■ 初学者向け解説(例え話や背景)

Text-to-Imageは、いわば「頭の中にある注文を言葉で伝えると、その場でパッと完璧な絵を描き上げてくれる専属の天才画家」のようなものです。「宇宙飛行士が月面でコーヒーを飲んでいるイラスト、油絵風で」といったテキストの指示(プロンプト)を受け取り、言葉の意味を画像として具現化する、現代のAIブームを象徴する大人気技術です。


■ 選択肢の解説

  • A) Text-to-Image(○): テキストを入力して新しい画像を生成するタスクです。正解です!
  • B) Image Captioning(×): 入力された画像の内容を読み取り、その状況説明の文章を自動生成するタスクです。
  • C) VQA(×): 画像とテキストの質問を入力し、テキストで回答を返すタスクです。
  • D) Zero-Shot画像分類(×): 事前の個別学習なしに、未知の画像クラスを高精度に分類する機械学習の手法です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?