AI PICKS
AI用語辞典音声・音楽

目的話者抽出 (Target Speaker Extraction)

読み: もくてきわしゃちゅうしゅつ

最終更新: 2026-07-31・AI PICKS編集部

定義

目的話者抽出とは、複数の話者が同時に発話する音声の中から、特定の目的話者の声だけを分離抽出する音声処理技術のこと。

目的話者抽出 (Target Speaker Extraction)とは — 詳しく解説

目的話者抽出(Target Speaker Extraction、TSE)は、複数話者の音声が重なった環境で、あらかじめ登録した目的話者の声のサンプル(エンロールメント音声)を手がかりに、その話者の発話だけを分離するディープラーニング技術とされる。話者の数や区別が未知のまま全員を分離する「話者分離」とは異なり、対象を先に指定できる点が実務上の強みとされる。会議の文字起こし、医療現場での問診録音、コールセンターの通話解析など、雑音や複数人発話が避けられない現場での前処理として採用が進んでいるとされる。2026年時点では、クラウドAPIとして処理時間や話者数に応じた従量課金で提供されることが多く、これが相場感の目安になるが、エンロールメント音声の質が低いと抽出精度が大きく落ちる点が実運用でのつまずきどころとして知られる。背景話者の声質が目的話者に近い場合や、マイクとの距離が変動する現場では誤抽出が増えやすく、導入前にPoCで実際の収録環境に近い音声で精度を確認することがコスト面も含めた選定の基本とされる。

目的話者抽出 (Target Speaker Extraction)の使用例

  • オンライン会議で複数人の発言が重なった録音から、事前に登録した自分の声だけを抽出し文字起こし精度を上げる用途。
  • コールセンターの通話録音でオペレーターの声だけを雑音や相手の声から分離し、音声解析にかける用途。

目的話者抽出 (Target Speaker Extraction)に関連するAIツール

関連用語

音声・音楽」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1263語以上を体系的に整理しています

辞典トップへ