【G検定過去問風テスト】音声の必須特徴量!MFCCの特徴を徹底解説

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

音声処理において、スペクトル包絡の情報をメル尺度に基づいて抽出し、音声認識の分野で最もよく使われる特徴量として、最も適切な選択肢を1つ選べ。

  • A)メル周波数ケプストラム係数 (MFCC)
  • B)高速フーリエ変換 (FFT)
  • C)隠れマルコフモデル (HMM)
  • D)パルス符号変調 (PCM)
🔍 ここをクリックして正解を見る
  • 正解: A)メル周波数ケプストラム係数 (MFCC)

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • MFCCは音声認識において最も広く使われている代表的な特徴量である
  • スペクトル包絡(音色の輪郭)の情報を、人間の聴覚特性に合わせた「メル尺度」に基づいて抽出する

■ 初学者向け解説(例え話や背景)

音声認識AIにとって、マイクが拾った生の音声波形は情報量が多すぎてそのままでは扱いにくいものです。そこで人間が音を聞き分ける仕組みをヒントにします。人間は低い音の変化には敏感ですが、高い音の変化には鈍感という特徴(メル尺度)を持っています。また、声の「大まかな形(スペクトル包絡)」が言葉の意味を決定づけます。MFCCはこれらを組み合わせ、AIが言葉を正しく聞き取れるように音の情報をギュッと効率よくまとめた「人間の耳に優しい数値のセット」とイメージしてください!


■ 選択肢の解説

  • A) メル周波数ケプストラム係数 (MFCC)(○): スペクトル包絡の情報をメル尺度に基づいて抽出した、音声認識で最もよく使われる特徴量です。
  • B) 高速フーリエ変換 (FFT)(×): 時間軸の複雑な音の波を「周波数成分」に分解するためのアルゴリズムであり、特徴量そのものではありません。
  • C) 隠れマルコフモデル (HMM)(×): 時系列データの状態遷移を確率的にモデル化したものであり、従来の音声認識などで使われたアルゴリズムです。
  • D) パルス符号変調 (PCM)(×): アナログの音声信号をデジタルデータ(バイナリコード)に変換する代表的な方式です。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?