【G検定過去問風テスト】MobileNetの核となる「Depthwise Separable Convolution」とは?
※本記事では、アフィリエイトプログラムより教材を紹介しています。
📝 問題
スマートフォンやエッジデバイス向けにGoogleが開発した軽量な画像認識モデル「MobileNet」において、計算量とパラメータ数を劇的に削減するために採用されている技術として、最も適切な選択肢を1つ選べ。
- A)教師モデルの確率分布(Soft Target)を小さな生徒モデルに模倣させる知識蒸留
- B)グループ畳み込みによって失われるチャネル間の情報を補うチャネルシャッフル
- C)空間方向の畳み込みとチャネル方向のまとめを2つのステップに分解する深度方向分離畳み込み
- D)学習データの数値表現の精度(ビット数)をFP32からINT8へ落とす量子化
🔍 ここをクリックして正解を見る
- 正解: C)空間方向の畳み込みとチャネル方向のまとめを2つのステップに分解する深度方向分離畳み込み
💡 合格に近づく!徹底解説
- 重要度: ★★★
■ 1分で分かる!この問題の要点
- MobileNetの最大の特徴は「Depthwise Separable Convolution(深度方向分離畳み込み)」である。
- 従来の畳み込みを「空間方向」と「チャネル方向」の2段階に分解して計算する。
- 精度をほとんど落とさずに、計算量とパラメータ数を1/8〜1/9程度に激減させることができる。
■ 初学者向け解説(例え話や背景)
通常の画像認識モデルで行われる畳み込みは、画像の「縦・横の広がり(空間)」と「色の情報(チャネル)」を一度にまとめてガッツリ計算するため、ものすごく頭を使います(=計算量が膨大になる)。これをスマホのような小さな端末でやると、すぐにバッテリーが熱を持ち、動きがカクカクになってしまいます。
そこで登場したのがMobileNetの心臓部である「Depthwise Separable Convolution」です。
これは仕事を2つの係にきれいに分業するイメージです。
- Depthwise Convolution: まず画像の色(RGBなどのチャネル)ごとに独立して、縦横の空間的な特徴だけを別々にコツコツ抽出します。
- Pointwise Convolution: 次に1x1の小さなフィルタを使って、別々に抽出した色情報をきれいに束ねて足し合わせます。
このように「分けて計算する」ことで、計算の手間を劇的にスリム化することに成功しました。G検定では、この仕組みの名称や「一括処理ではなく分離している」という点がよく問われます!
■ 選択肢の解説
- A) 知識蒸留の説明(×):教師モデルの確率分布を生徒モデルに模倣させる「知識蒸留」の説明であり、MobileNetの構造ではありません。
- B) ShuffleNetの説明(×):グループ畳み込みとチャネルシャッフルに関する説明であり、ShuffleNetの特徴です。
- C) Depthwise Separable Convolutionの正しい説明(○):MobileNetで採用されている空間方向とチャネル方向の分離畳み込みを正しく表現しています。
- D) 量子化の説明(×):数値表現の精度(ビット数)を落とす「量子化」の説明です。
👉 次の問題&解説テキスト
お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?
