目的話者抽出 (Target Speaker Extraction)
読み: もくてきわしゃちゅうしゅつ
最終更新: 2026-07-31・AI PICKS編集部
定義
目的話者抽出とは、複数の話者が同時に発話する音声の中から、特定の目的話者の声だけを分離抽出する音声処理技術のこと。
目的話者抽出 (Target Speaker Extraction)とは — 詳しく解説
目的話者抽出(Target Speaker Extraction、TSE)は、複数話者の音声が重なった環境で、あらかじめ登録した目的話者の声のサンプル(エンロールメント音声)を手がかりに、その話者の発話だけを分離するディープラーニング技術とされる。話者の数や区別が未知のまま全員を分離する「話者分離」とは異なり、対象を先に指定できる点が実務上の強みとされる。会議の文字起こし、医療現場での問診録音、コールセンターの通話解析など、雑音や複数人発話が避けられない現場での前処理として採用が進んでいるとされる。2026年時点では、クラウドAPIとして処理時間や話者数に応じた従量課金で提供されることが多く、これが相場感の目安になるが、エンロールメント音声の質が低いと抽出精度が大きく落ちる点が実運用でのつまずきどころとして知られる。背景話者の声質が目的話者に近い場合や、マイクとの距離が変動する現場では誤抽出が増えやすく、導入前にPoCで実際の収録環境に近い音声で精度を確認することがコスト面も含めた選定の基本とされる。
目的話者抽出 (Target Speaker Extraction)の使用例
- オンライン会議で複数人の発言が重なった録音から、事前に登録した自分の声だけを抽出し文字起こし精度を上げる用途。
- コールセンターの通話録音でオペレーターの声だけを雑音や相手の声から分離し、音声解析にかける用途。
目的話者抽出 (Target Speaker Extraction)に関連するAIツール
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1263語以上を体系的に整理しています
辞典トップへ