【G検定過去問風テスト】時系列の長さの違いを克服!CTCの仕組みを解説

※本記事では、アフィリエイトプログラムより教材を紹介しています。

📝 問題

入力音声の長さ(フレーム数)と、出力テキストの長さ(文字数)が一致しないタスクにおいて、そのずれを自動的にアライメント(位置合わせ)して処理するために用いられる損失関数・手法として、最も適切な選択肢を1つ選べ。

  • A)CTC
  • B)WaveNet
  • C)MFCC
  • D)FFT
🔍 ここをクリックして正解を見る
  • 正解: A)CTC

💡 合格に近づく!徹底解説

  • 重要度: ★★★

■ 1分で分かる!この問題の要点

  • CTC(Connectionist Temporal Classification)は、時系列データの位置合わせを行う損失関数・手法である
  • 入力音声の長さ(フレーム数)と出力文字の長さ(文字数)がバラバラでも対応できる
  • 音声認識などで、文字と音声の対応付け(アライメント)を自動で行うために欠かせない技術

■ 初学者向け解説(例え話や背景)

私たちが「あーーーりーーがーーとーー」と言葉を伸ばして話したとき、マイクが捉える音声データの長さ(フレーム数)は非常に長くなります。しかし、それを文字に直した「ありがとう」というテキストの文字数はわずか5文字です。このように「音の長さ」と「文字の数」はバラバラです。例えるなら、長いテープに記録された音楽のどの部分がどの歌詞に対応しているのかを自動でぴったり結びつける「優秀なパズル調整役」がCTCです。この仕組みがあるおかげで、AIは音声の長さや話すスピードを気にせず正確に文字起こしができるのです!


■ 選択肢の解説

  • A) CTC(○): 入力と出力の長さが一致しないタスクにおいて、自動でアライメント(位置合わせ)を行う損失関数・手法です。
  • B) WaveNet(×): 生の音声波形を直接1サンプルずつ生成し、自然な音声合成を実現するディープラーニングモデルです。
  • C) MFCC(×): スペクトル包絡の情報をメル尺度に基づいて抽出し、音声認識で広く使われる特徴量です。
  • D) 高速フーリエ変換 (FFT)(×): 時間軸の音の波を周波数成分に分解する数理アルゴリズムです。

👉 次の問題&解説テキスト

お疲れ様です!
この調子で次の問題に挑戦しますか?
それとも、立ち止まって詳しい解説を確認しますか?