メルスペクトログラム (Mel Spectrogram)
読み: めるすぺくとろぐらむ
最終更新: 2026-07-24・AI PICKS編集部
定義
メルスペクトログラムとは、音声波形の周波数成分を人間の聴覚特性に近いメル尺度で分割し、時間軸に沿って表現した2次元の音響特徴量のこと。
メルスペクトログラム (Mel Spectrogram)とは — 詳しく解説
メルスペクトログラムは、音声波形を短時間フーリエ変換(STFT)で周波数分解した後、人間の聴覚が低音域を細かく高音域を粗く感じる特性に合わせてメル尺度のフィルタバンクでビン分割し、対数振幅に変換した時間・周波数の2次元表現。音声認識・音声合成(TTS)・話者識別・音楽情報検索など多くの音声AIモデルで、生波形の代わりに入力または出力の中間特徴量として業界標準的に採用されている。実運用での落とし穴は、STFTの窓幅・ホップ長・メルbin数・サンプリングレートといったパラメータが学習時と推論時でずれると精度が大きく劣化する点で、事前学習済みモデルを使う場合は必ず前処理条件を揃える必要がある。2026年時点、TTSやボイスクローニング系サービスの多くはメルスペクトログラムを中間表現としてvocoderに渡す2段構成を採るため、現場でモデルを選ぶ際は組み合わせるvocoderとの相性を確認したい。処理自体はlibrosa等のライブラリで低コストに実行できるが、大量音声をバッチ変換する場合はGPU/CPU計算コストが積み上がる点も相場感として押さえておくべきだ。
メルスペクトログラム (Mel Spectrogram)の使用例
- 16kHzの音声をSTFT変換後、メルフィルタバンクで80次元のメルスペクトログラムに変換し音声認識モデルへ入力する。
- TTSモデルがテキストからメルスペクトログラムを予測し、その後vocoderで波形に変換する2段階構成が広く使われる。
メルスペクトログラム (Mel Spectrogram)に関連するAIツール
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・913語以上を体系的に整理しています
辞典トップへ