MFCC (メル周波数ケプストラム)
読み: めるしゅうはすうけぷすとらむ
最終更新: 2026-07-24・AI PICKS編集部
定義
MFCCとは、音声波形を人間の聴覚特性に近いメル尺度でスペクトル分析し、少ない係数で音色的特徴を圧縮表現する、音声認識・話者識別で広く使われる特徴量のこと。
MFCC (メル周波数ケプストラム)とは — 詳しく解説
MFCCは音声信号のスペクトルを、人間の聴覚特性に近いメル尺度のフィルタバンクに通して対数を取り、離散コサイン変換(DCT)で少数の係数に圧縮した特徴量で、音声認識・話者識別・音楽ジャンル分類など音響機械学習の入力として業界標準的に使われてきた。2026年時点の実運用では、End-to-Endの深層学習モデルがMFCC相当の特徴を内部で自動学習してしまうため、明示的にMFCCを使うか生波形/メルスペクトログラムを直接渡すかの設計判断が現場で生じる。落とし穴は、ノイズや残響が強い実環境の音源では識別力が理想条件より大きく落ちる点、フレーム長やフィルタ数の調整が精度を左右する点。コスト面では計算自体は軽量でCPUでも動くため追加費用の相場感はほぼ発生しないが、大規模データセットの前処理パイプライン構築には相応の工数がかかる。現場での選び方は、軽量・解釈性重視の用途はMFCCベース、精度最優先の用途はEnd-to-Endモデルが実務上の目安とされる。
MFCC (メル周波数ケプストラム)の使用例
- 音声クローンツールの前処理でMFCC係数を抽出し、話者性を表す特徴ベクトルとしてモデルに入力する。
- 「このボイスチェンジャーはMFCCベースの古典的手法ですか、End-to-Endの深層学習モデルですか」とベンダーに確認する。
MFCC (メル周波数ケプストラム)に関連するAIツール
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・913語以上を体系的に整理しています
辞典トップへ