AI PICKS
AI用語辞典音声・音楽

MFCC (メル周波数ケプストラム)

読み: めるしゅうはすうけぷすとらむ

最終更新: 2026-07-24・AI PICKS編集部

定義

MFCCとは、音声波形を人間の聴覚特性に近いメル尺度でスペクトル分析し、少ない係数で音色的特徴を圧縮表現する、音声認識・話者識別で広く使われる特徴量のこと。

MFCC (メル周波数ケプストラム)とは — 詳しく解説

MFCCは音声信号のスペクトルを、人間の聴覚特性に近いメル尺度のフィルタバンクに通して対数を取り、離散コサイン変換(DCT)で少数の係数に圧縮した特徴量で、音声認識・話者識別・音楽ジャンル分類など音響機械学習の入力として業界標準的に使われてきた。2026年時点の実運用では、End-to-Endの深層学習モデルがMFCC相当の特徴を内部で自動学習してしまうため、明示的にMFCCを使うか生波形/メルスペクトログラムを直接渡すかの設計判断が現場で生じる。落とし穴は、ノイズや残響が強い実環境の音源では識別力が理想条件より大きく落ちる点、フレーム長やフィルタ数の調整が精度を左右する点。コスト面では計算自体は軽量でCPUでも動くため追加費用の相場感はほぼ発生しないが、大規模データセットの前処理パイプライン構築には相応の工数がかかる。現場での選び方は、軽量・解釈性重視の用途はMFCCベース、精度最優先の用途はEnd-to-Endモデルが実務上の目安とされる。

MFCC (メル周波数ケプストラム)の使用例

  • 音声クローンツールの前処理でMFCC係数を抽出し、話者性を表す特徴ベクトルとしてモデルに入力する。
  • 「このボイスチェンジャーはMFCCベースの古典的手法ですか、End-to-Endの深層学習モデルですか」とベンダーに確認する。

MFCC (メル周波数ケプストラム)に関連するAIツール

関連用語

音声・音楽」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・913語以上を体系的に整理しています

辞典トップへ