メルスペクトログラムは、人間の聴覚特性に合わせて周波数軸を対数的なメル尺度に変換した音声のスペクトログラムです。音声認識や音声合成などのAIモデルの入力データとして広く利用されています。
メルスペクトログラムとは
一言でいうと、人間の耳の聞こえ方に近づけて音声を視覚化した2次元データのことです。
詳しく解説
音声信号をAIに処理させる際、通常の周波数スペクトログラムをそのまま使うとデータ量が膨大になり、人間の聴覚特性とは異なる機械的な処理になってしまいます。人間の耳は低音域の変化には敏感ですが、高音域の変化には鈍感です。そこで、周波数軸を人間の聴覚特性に合わせたメル尺度に変換することで、効率的かつ知覚的に自然な特徴量を抽出できるようになります。これがメルスペクトログラムであり、深層学習を用いた音声認識や音声合成の分野において標準的な入力表現として重要な役割を果たしています。
具体例・使われ方
音声認識モデルにおいて、話者の音声をマイクから取得したのちにメルスペクトログラムに変換し、それを畳み込みニューラルネットワークに入力してテキストへ書き起こします。また、音声合成モデルでは、テキストから生成された特徴量を一度メルスペクトログラムに変換し、それを波形に戻すことで人工音声を生成します。
似た用語との違い
通常のスペクトログラムが物理的な周波数と時間の関係を均等にプロットするのに対し、メルスペクトログラムは人間の聴覚特性に合わせて高音域の解像度を粗く、低音域を細かく調整している点が異なります。また、MFCCとも混同されやすいですが、MFCCはメルスペクトログラムに対してさらに離散コサイン変換を適用して次元圧縮を行ったものであり、情報の詳細さが異なります。
注意点
メルスペクトログラムは可逆的な変換ではないため、一般的には位相情報が失われます。そのため、これ単体から元の音声波形を完璧に再構築することは難しく、再構築にはボコーダーなどの追加モデル技術が必要になる点に注意が必要です。