AI PICKS

ストリーミングTTS (Streaming TTS)読み: すとりーみんぐてぃーてぃーえす

2026-07-27 更新
AI用語辞典音声・音楽最終更新: 2026-07-27・AI PICKS編集部
定義

ストリーミングTTSとは、テキストを音声に変換する処理の完了を待たずに、生成済みの音声チャンクを逐次再生することで応答の体感遅延を大幅に短縮する音声合成方式のこと。

ストリーミングTTS (Streaming TTS)とは(詳しく解説)

ストリーミングTTSは、音声合成モデルが文章全体の生成完了を待たず、生成済みの音声チャンクを逐次クライアントへ送出する方式のことで、業界標準的にはWebSocketやHTTPチャンク転送で実装される。従来型のバッチTTSは全文生成後に音声ファイルを返すため数百ms〜数秒の遅延が発生するが、ストリーミングTTSは最初の音声チャンクを数十〜100ms程度で返せるため、音声エージェントやリアルタイム対話UIとの親和性が高いとされる。2026年時点の実運用では、音声対話型AIアシスタントやコールセンター自動応答での採用が広がっているが、現場ではネットワーク遅延やチャンク分割位置による不自然な間の発生が落とし穴になりやすく、文単位ではなく音素・トークン単位でのチャンク設計が重要とされる。相場感としては通常のTTSと同程度の従量課金に加え、常時接続を維持するコストが上乗せされるケースが多く、同時接続数が多いほどコスト構造への影響が大きくなる点に注意が必要とされる。選定時は対応言語の自然さ、割り込み対応の有無、レイテンシのSLAを比較するのが定石とされる。

この解説の引用について

定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。

出典: AI PICKS AI用語辞典「ストリーミングTTS (Streaming TTS)とは」 https://aipicks.jp/glossary/streaming-tts

ストリーミングTTS (Streaming TTS)の使用例

  • 音声対話エージェントにストリーミングTTS対応モデルを組み込み、発話開始までの体感待ち時間を数百msから100ms程度へ短縮する構成。
  • コールセンター自動応答でチャンク単位の音声送出を採用し、割り込み発話への対応と発話開始の速さを両立させる設計。

ストリーミングTTS (Streaming TTS)に関連するAIツール

ストリーミングTTS (Streaming TTS)の関連記事

用語がわかったら、次はツール選び

12カテゴリ・1716語以上を体系的に整理しています