【G検定過去問風テスト】知識蒸留の仕組みと「生徒モデル」の特徴

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

ディープラーニングモデルの軽量化手法の一つである「知識蒸留(Knowledge Distillation)」に関する説明として、最も適切な選択肢を1つ選べ。

  • A)学習済みの巨大な教師モデルのパラメータ数をそのまま維持した状態で、複数台のサーバーに分散させて推論を高速化する手法である。
  • B)サイズが大きく高精度な教師モデルが出力する確率分布(Soft Target)のニュアンスを、小さな生徒モデルに模倣させて学習させる手法である。
  • C)ニューラルネットワークの結合のうち、予測結果への寄与度が低い重みを0にしてスパース化する手法である。
  • D)モバイル端末向けに、入力画像の空間方向とチャネル方向の計算を2つのステップに分解して畳み込みを行う手法である。
🔍 ここをクリックして正解を見る
  • 正解: B)サイズが大きく高精度な教師モデルが出力する確率分布(Soft Target)のニュアンスを、小さな生徒モデルに模倣させて学習させる手法である。

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • 知識蒸留は、大きな「教師モデル(Teacher Model)」の知識を小さな「生徒モデル(Student Model)」に引き継ぐ技術である。
  • 単なる正解ラベル(Hard Target)だけでなく、確率分布(Soft Target:例「犬80%、猫15%、馬5%」といった予測のニュアンス)を模倣させるのがポイント。
  • 小さなモデルでありながら、教師モデルに近い高い精度を実現できる。

■ 初学者向け解説(例え話や背景)

知識蒸留は、言ってみれば「ベテラン講師が要約版テキストを作る作業」に例えられます。

豊富な知識を持つベテラン講師(教師モデル)が、長年の経験から得た「ここがポイントだよ」「ここは少し間違えやすいけど惜しいよね」といった深いニュアンス(確率分布=Soft Target)を含んだ分かりやすい要約ノートを、新人の生徒(生徒モデル)に引き継ぎます。
生徒モデル自身は体格が小さく(パラメータ数が少なく)ても、ベテラン講師の「教え方(ニュアンス)」をそのまま模倣して学ぶことで、いきなり自力で一から勉強するよりも遥かに高い精度を効率よく身につけることができるのです。

G検定では、「正解ラベル(Hard Target)だけを学ぶのではなく確率分布を学ぶ点」や「生徒モデルの方が小さくなる点」がよくひっかけとして狙われます!


■ 選択肢の解説

  • A) サーバー分散に関する説明(×): パラメータ数を維持したままサーバーを分ける手法ではなく、知識蒸留は小さなモデルへ知識を移行する手法です。
  • B) 知識蒸留の正しい説明(○): 教師モデルの出力する確率分布(Soft Target)を小さな生徒モデルに模倣させるという、知識蒸留の本質を正しく表しています。
  • C) 剪定の説明(×): 不要な重みを0にして削減する「剪定(プルーニング)」の説明です。
  • D) MobileNetの説明(×): 空間とチャネルを分離する「Depthwise Separable Convolution」の仕組みを説明したものです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?