Unreal Speechとは

Unreal Speechは「最も安価なTTS API」を掲げる、コスト最適化に特化したテキスト読み上げAPIです。公式サイトでは同等の用途においてElevenLabs比で11倍安い(月49ドル vs 510ドル)という料金比較を前面に打ち出しており、大量のテキストを継続的に音声化する用途ほど単価差が効いてきます。無料プランは月25万文字(音声換算で約6時間分)まで利用できます。

主要機能

低レイテンシ・ストリーミング: /streamエンドポイントは最大1,000文字を0.3秒程度で音声化でき、対話型アプリやエージェントへの組み込みに向きます。

長尺コンテンツ対応: /synthesisTasksでは最大50万文字を非同期処理でき、1回のリクエストで最長10時間の音声出力に対応します。

単語単位のタイムスタンプ: 音声と同期した単語ハイライト表示向けに、単語ごとの開始・終了時刻を取得できます。

大量処理の実績: 公式発表では月間70億文字の処理実績、稼働率99.9%を掲げています。

想定ユーザー

英語ナレーションを大量に処理する動画制作会社やeラーニング事業者、処理コストを重視する開発チームに向いています。日本語音声の品質については公式サイトに明記がなく、日本語メイン用途では別途検証が必要です。