【G検定過去問風テスト】画像認識の根拠を示すGrad-CAMの仕組み
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
画像認識(CNN)において、AIが画像のどの部分を見てその判断を下したのかを可視化する手法であるGrad-CAM(Gradient-weighted Class Activation Mapping)に関する説明として、最も適切な選択肢を1つ選べ。
- A)モデルの中身に依存せず、入力データの周辺にノイズを加えたデータを大量に作ってシンプルな代理モデルを当てはめる手法である
- B)入力データを真っ黒な状態から少しずつ変化させながら勾配を足し合わせることで、各ピクセルの寄与度を算出する手法である
- C)畳み込み層の最後尾の特徴マップに対する予測クラスの勾配情報を利用し、画像のどこを見て判断したかをヒートマップとして表示する手法である
- D)協力ゲーム理論のシャープレイ値に基づき、各特徴量が予測結果にどれだけ貢献したかを公理的に算出する手法である
🔍 ここをクリックして正解を見る
- 正解: C)畳み込み層の最後尾の特徴マップに対する予測クラスの勾配情報を利用し、画像のどこを見て判断したかをヒートマップとして表示する手法である
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- Grad-CAMは「画像認識(CNN)」に特化した視覚的なXAI手法
- ネットワークの最後の畳み込み層が持つ「勾配(Gradient)」を利用して、画像のどのエリアに注目してクラス判定したかをヒートマップで可視化する
■ 初学者向け解説(例え話や背景)
AIが写真を見て「これは犬だ!」と判定したとき、「写真のどの部分(耳なのか、しっぽなのか)を見てそう判断したのか」が気になりますよね。それを視覚的に暴いてくれるのがGrad-CAMです。
例えるなら、犯人が現場に残した足跡や指紋をたどって、犯行の証拠を突き止めた捜査で、「どの情報を重要視したか(勾配情報)」を見える化するようなものです。Grad-CAMはCNN(畳み込みニューラルネットワーク)の仕組みに深く依存しているため、LIMEやSHAPのような「どんなモデルにも使える(モデル非依存)」手法とは異なり、「CNN専用(モデル依存)」の手法である点がG検定のひっかけ問題でよく狙われます。
■ 選択肢の解説
- A) モデルの中身に依存せず、入力データの周辺にノイズを加えたデータを大量に作ってシンプルな代理モデルを当てはめる手法である(×): これはLIMEの説明です。
- B) 入力データを真っ黒な状態から少しずつ変化させながら勾配を足し合わせることで、各ピクセルの寄与度を算出する手法である(×): これはIntegrated Gradientsの説明です。
- C) 畳み込み層の最後尾の特徴マップに対する予測クラスの勾配情報を利用し、画像のどこを見て判断したかをヒートマップとして表示する手法である(○): Grad-CAMの仕組みを正確に表しています。
- D) 協力ゲーム理論のシャープレイ値に基づき、各特徴量が予測結果にどれだけ貢献したかを公理的に算出する手法である(×): これはSHAPの説明です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
