【G検定過去問風テスト】言葉から絵を描き出す!Text-to-Imageの仕組み
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
プロンプト(テキストの指示文)を入力すると、その内容に合致した新しい画像をAIが生成するマルチモーダル関連のタスクとして、最も適切なものを1つ選べ。
- A)Text-to-Image
- B)Image Captioning
- C)VQA(Visual Question Answering)
- D)Zero-Shot画像分類
🔍 ここをクリックして正解を見る
- 正解: A)Text-to-Image
💡 合格に近づく!徹底解説
- 重要度: ★★☆
■ 1分で分かる!この問題の要点
- Text-to-Image(テキスト画像生成): 「テキスト(言葉の指示)」を入力すると、AIがゼロから「画像」を作り出すタスク。
- MidjourneyやStable Diffusionなどが代表例で、背景にはCLIPなどの言語・画像共有空間の技術が活用されている。
■ 初学者向け解説(例え話や背景)
Text-to-Imageは、いわば「頭の中にある注文を言葉で伝えると、その場でパッと完璧な絵を描き上げてくれる専属の天才画家」のようなものです。「宇宙飛行士が月面でコーヒーを飲んでいるイラスト、油絵風で」といったテキストの指示(プロンプト)を受け取り、言葉の意味を画像として具現化する、現代のAIブームを象徴する大人気技術です。
■ 選択肢の解説
- A) Text-to-Image(○): テキストを入力して新しい画像を生成するタスクです。正解です!
- B) Image Captioning(×): 入力された画像の内容を読み取り、その状況説明の文章を自動生成するタスクです。
- C) VQA(×): 画像とテキストの質問を入力し、テキストで回答を返すタスクです。
- D) Zero-Shot画像分類(×): 事前の個別学習なしに、未知の画像クラスを高精度に分類する機械学習の手法です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?

