定義
MFCCとは、音声波形を人間の聴覚特性に近いメル尺度でスペクトル分析し、少ない係数で音色的特徴を圧縮表現する、音声認識・話者識別で広く使われる特徴量のこと。
MFCC (メル周波数ケプストラム)とは(詳しく解説)
MFCCは音声信号のスペクトルを、人間の聴覚特性に近いメル尺度のフィルタバンクに通して対数を取り、離散コサイン変換(DCT)で少数の係数に圧縮した特徴量で、音声認識・話者識別・音楽ジャンル分類など音響機械学習の入力として業界標準的に使われてきた。2026年時点の実運用では、End-to-Endの深層学習モデルがMFCC相当の特徴を内部で自動学習してしまうため、明示的にMFCCを使うか生波形/メルスペクトログラムを直接渡すかの設計判断が現場で生じる。落とし穴は、ノイズや残響が強い実環境の音源では識別力が理想条件より大きく落ちる点、フレーム長やフィルタ数の調整が精度を左右する点。コスト面では計算自体は軽量でCPUでも動くため追加費用の相場感はほぼ発生しないが、大規模データセットの前処理パイプライン構築には相応の工数がかかる。現場での選び方は、軽量・解釈性重視の用途はMFCCベース、精度最優先の用途はEnd-to-Endモデルが実務上の目安とされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「MFCC (メル周波数ケプストラム)とは」 https://aipicks.jp/glossary/mfcc
MFCC (メル周波数ケプストラム)の使用例
- 音声クローンツールの前処理でMFCC係数を抽出し、話者性を表す特徴ベクトルとしてモデルに入力する。
- 「このボイスチェンジャーはMFCCベースの古典的手法ですか、End-to-Endの深層学習モデルですか」とベンダーに確認する。