データ前処理機械学習音声認識

スペクトログラム

すぺくとろぐらむ · Spectrogram
18 views

スペクトログラムとは、音声や音楽などの信号が持つ周波数の変化を時間経過とともに視覚化した画像データです。AIによる音声認識や音楽生成モデルにおいて、音声波形をコンピュータが効率的に学習するための重要な入力データとして活用されています。

スペクトログラムとは

スペクトログラムとは、横軸に時間、縦軸に周波数、色の濃淡や明暗で信号の強度(振幅)を表した2次元のグラフ・画像のことです。

詳しく解説

音声信号はそのままでは時間の経過に伴う周波数の変化が複雑なため、機械学習モデルで直接扱うのは困難です。そこで、音声波形に対して短時間フーリエ変換(STFT)などの数学的処理を施すことで、どの時間帯にどの周波数の音がどれだけ含まれているかを分解し、スペクトログラムを生成します。これにより、音声データの特徴を画像として表現できるようになり、CNN(畳み込みニューラルネットワーク)などの画像処理用アーキテクチャをそのまま音声認識や音声合成、音楽生成などのタスクに応用することが可能になりました。

具体例・使われ方

AIを用いた音声文字起こしシステムの前処理として、マイクから入力された音声波形をスペクトログラムに変換してモデルに入力します。また、Text-to-Speech(音声合成)モデルにおいて、テキストから生成された中間表現としてスペクトログラムが出力され、最終的にそれを音声波形に再変換するパイプラインで広く利用されています。

似た用語との違い

生データである「音声波形」が1次元の時系列データであるのに対し、スペクトログラムは時間と周波数を軸にした2次元の画像データである点が異なります。また、人間の聴覚特性に合わせて周波数軸を対数スケールに変換した「メル・スペクトログラム」は、AIの音声認識でより頻繁に用いられます。

注意点

スペクトログラムを生成する際のパラメータ(窓幅やホップ長など)の設定によって情報の解像度が変わり、モデルの性能に大きな影響を与えます。また、一度スペクトログラムに変換してから波形に戻す逆変換の過程では、位相情報が失われるか近似されるため、元の音声にわずかな劣化やノイズが生じる場合があります。

更新日時: 2026年9月19日 02:15