機械学習深層学習音声処理

メル尺度スペクトログラム

めるしゃくどすぺくとろぐらむ · Mel Spectrogram
18 views

メル尺度スペクトログラムとは、人間の聴覚特性に合わせて周波数軸を変換した音声データの可視化表現です。低音域を細かく、高音域を粗く捉える「メル尺度」を用いることで、AIによる音声認識や音声合成の入力・中間特徴量として広く活用されています。

メル尺度スペクトログラムとは

メル尺度スペクトログラムとは、人間の耳が感じる音の高低特性(メル尺度)を考慮して音声を時間・周波数・強度の2次元画像のように表現した音響特徴量です。

詳しく解説

音声信号は時間経過とともに周波数成分が変化します。まず音声を短い区間に区切って短時間フーリエ変換(STFT)を行うことで、通常のスペクトログラムを生成します。しかし、人間の聴覚は周波数の変化を線形には認識せず、低い周波数の変化には敏感で、高い周波数の変化には鈍感です。そこで、この聴覚特性を近似したメル尺度に基づくフィルターバンクを通すことで、周波数軸を変換したものがメル尺度スペクトログラムです。深層学習を用いた音声モデルでは、波形データをそのまま扱うよりも次元削減や重要特徴の抽出が容易になるため、音声処理パイプラインの標準的な入力表現として重要視されています。

具体例・使われ方

音声認識システムにおいて、マイクから入力された音声を画像データのように畳み込みニューラルネットワークに入力してテキストへ変換する用途や、テキストから音声波形を生成する音声合成(TTS)において中間生成物として利用される例があります。また、環境音の分類や話者識別の特徴量としても頻繁に用いられます。

似た用語との違い

通常のスペクトログラムが物理的な周波数を均等に扱うのに対し、メル尺度スペクトログラムは人間の知覚に合わせて低音域の解像度を重視しています。また、メル尺度スペクトログラムからさらに離散コサイン変換を適用して情報圧縮を行ったMFCC(メル周波数ケプストラム係数)と比較すると、メル尺度スペクトログラムの方が情報保持量が多く、近年の深層学習モデルと相性が良いとされています。

注意点

メル尺度スペクトログラムへの変換過程では位相情報が失われるため、メル尺度スペクトログラムから元の音声波形を再構築する際には、ニューラルボコーダーなどの追加の復元技術が必要となります。また、サンプリングレートやフレームサイズ、メルフィルターバンクの設計パラメータによって得られる表現が変わる点に注意が必要です。

更新日時: 2026年9月20日 19:45