【G検定過去問風テスト】アテンションマップによる解釈・可視化技術

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

Transformerなどのアテンション機構を持つAIモデルにおいて、モデルの解釈性を高めるために用いられる「アテンションマップ」に関する記述として、最も適切な選択肢を1つ選べ。

  • A)入力データを真っ黒な状態から少しずつ変化させながら勾配を足し合わせることで、各ピクセルの寄与度を算出する手法である
  • B)モデルが入力されたテキストのどの単語や画像のどの領域に対して強い注意(重み)を向けたかを可視化した行列や図のことである
  • C)特定の1つの入力データの周辺に少しノイズを加えたデータを大量に作り、シンプルな線形モデルを当てはめる手法である
  • D)協力ゲーム理論のシャープレイ値に基づき、各特徴量の予測結果に対する貢献度を公理的に算出する手法である
🔍 ここをクリックして正解を見る
  • 正解: B)モデルが入力されたテキストのどの単語や画像のどの領域に対して強い注意(重み)を向けたかを可視化した行列や図のことである

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • 「アテンションマップ」は、Transformerなどのアテンション機構において、AIが「文章のどこ(どの単語)を特にじっと見ているか」を視覚化したもの
  • 自然言語処理やマルチモーダルモデルにおいて、推論の根拠を探るための重要な解釈・可視化アプローチ

■ 初学者向け解説(例え話や背景)

人間が長い文章を読むとき、重要なキーワードにマーカーを引いたり、文脈のつながりを意識しながら読んだりしますよね。Transformerなどのモデルに搭載されている「アテンション機構」もこれと似ていて、「どの単語とどの単語が強く結びついているか」を計算しています。

この計算で使われる「注目度の重み(アテンション・ウェイト)」を、色の濃淡などでマトリックス状やグラフ状に視覚化したものがアテンションマップです。例えば、「はしで豆をつかんで食べる」という文脈で「はし」という単語を処理するとき、AIが「豆」や「食べる」という周辺の単語に強く注目している様子をアテンションマップで見れば、「あ、川にかかる橋ではなくお箸のほうをちゃんと理解しているな」と納得(解釈)することができます。


■ 選択肢の解説

  • A) 入力データを真っ黒な状態から少しずつ変化させながら勾配を足し合わせることで、各ピクセルの寄与度を算出する手法である(×): これはIntegrated Gradientsの説明です。
  • B) モデルが入力されたテキストのどの単語や画像のどの領域に対して強い注意(重み)を向けたかを可視化した行列や図のことである(○): アテンションマップの本質を正確に表しています。
  • C) 特定の1つの入力データの周辺に少しノイズを加えたデータを大量に作り、シンプルな線形モデルを当てはめる手法である(×): これはLIMEの説明です。
  • D) 協力ゲーム理論のシャープレイ値に基づき、各特徴量の予測結果に対する貢献度を公理的に算出する手法である(×): これはSHAPの説明です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?