音声対話の遅延収支 (Latency Budget)
読み: おんせいたいわのちえんしゅうし
最終更新: 2026-08-31・AI PICKS編集部
定義
音声対話の遅延収支とは、ASR・LLM応答・TTSの各処理時間を人間が違和感なく会話できる合計時間内に収める設計上の予算配分のこと。
音声対話の遅延収支 (Latency Budget)とは — 詳しく解説
音声対話の遅延収支(レイテンシーバジェット)とは、音声AIエージェントが人間との自然な会話を成立させるために、発話終了検知からAI応答の音声出力開始までに許容できる総時間を、音声認識(ASR)・LLM推論・音声合成(TTS)・ネットワーク往復といった各処理段階に配分する設計手法とされる。一般に会話の間として不自然に感じられない目安は数百ミリ秒台とされ、この枠を各コンポーネントでどう分け合うかがUX品質を左右する。2026年時点の実運用では、ストリーミングTTSや部分応答の先出し、ASRとLLMの並列処理などで体感遅延を縮める設計が広く採用されている一方、リアルタイム性の高い音声基盤モデルは推論コストが相対的に高く、相場感としてはテキストチャットより従量コストが嵩みやすい点が現場での選定ネックになりやすい。用途の許容遅延・想定同時接続数・コスト上限を先に定義し、その枠内でASR/LLM/TTSの構成を選ぶ順番が実務では推奨される。
音声対話の遅延収支 (Latency Budget)の使用例
- 新規音声エージェント設計時に、ASR・LLM・TTS各処理へどう時間配分するかを検討する際の指標として遅延収支を用いる。
- 既存の音声UXが「間延びして感じる」場合に、遅延収支のどの区間がボトルネックかを切り分ける際に使う。
音声対話の遅延収支 (Latency Budget)に関連するAIツール
音声対話の遅延収支 (Latency Budget)の関連記事
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
用語がわかったら、次はツール選び
12カテゴリ・1568語以上を体系的に整理しています