音声言語理解 (SLU)
読み: おんせいげんごりかい
最終更新: 2026-07-20・AI PICKS編集部
定義
音声言語理解(SLU)とは、音声認識で文字化した発話から意図やエンティティを抽出し、システムが人間の発話内容を理解できる形に変換する技術のこと。
音声言語理解 (SLU)とは — 詳しく解説
SLU(Spoken Language Understanding)は、音声認識(ASR)で得た文字列から意図分類とエンティティ抽出を行い、発話の意味を構造化する技術で、音声アシスタントやコールセンターのボイスボットの中核として広く採用されているとされる。ASRとNLUを組み合わせるパイプライン型と、音声から直接意味を出力するEnd-to-End型の2系統があるとされる。2026年時点の実運用では、雑音や方言、専門用語を含む発話でASRの誤認識が連鎖し、後段の意図判定精度が大きく落ちる点が現場でのつまずきどころとされる。コールセンター向けの導入は通話量に応じた従量課金が主流で、相場感としては月間通話量が多いほど1件あたりのコストは下がるが、初期のドメイン適応にまとまった工数がかかる点は見落とされがちとされる。現場でツールを選ぶ際は、汎用エンジンの精度だけでなく、自社データでのチューニングのしやすさやフォールバック設計まで含めて比較検討することが重要とされる。
音声言語理解 (SLU)の使用例
- コールセンターの通話ログをSLUで解析し、問い合わせ意図ごとに自動分類してオペレーターに転送する。
- スマートスピーカーが「今日の天気は」という発話からintent=天気確認、entity=今日を抽出して応答する。
音声言語理解 (SLU)に関連するAIツール
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・763語以上を体系的に整理しています
辞典トップへ