ElevenLabsの発表内容
ElevenLabsは、音声生成AIの新モデル「Eleven v4」と高速版「Eleven v4 Turbo」の提供を開始しました。開発者向けAPIのほか、同社の制作ツールや対話エージェント機能ですぐに利用できます。
「Eleven v4」は、感情表現や話す速度を細かく制御できるモデルです。台本の中にタグを書き込むだけで、笑い声や囁き声、ドアが閉まる効果音を直接指定できます。90以上の言語に対応し、10秒の音声から話者の声を再現する機能や、長文でも声質を一定に保つ仕組みを備えています。
対話向けの「Eleven v4 Turbo」は、推論遅延の中央値が約100ミリ秒と低遅延で動作します。提供開始から2週間は記念割引が適用されます。API料金は100万文字あたり、「Eleven v4」が22ドル、「Eleven v4 Turbo」が11ドルです。
この2つのモデルにより、電話窓口や予約受付での応答がスムーズになり、より自然な顧客体験を提供できます。制作の現場でも、長文の朗読やキャラクターのセリフを安定した声質で出力できます。
つまり、どういうこと?
ざっくり言うと、声優のように感情を込めて喋れるAI音声が、電話の相づちでも待たされない速さで動くようになった、ということです。
台本に「小声で」「笑う」といった指示を書き込むだけで、最初から最後まで同じ人物のトーンを崩さずに自然に演じ分けてくれます。
編集部の見方

筆者が特に驚いたのは、音声の推論遅延が約100ミリ秒まで縮まった点です。電話の自動応答では、わずかな間が空くだけで相手に違和感を与えてしまいます。この壁を破ったことで、AIによる電話対応は一気に現実味を帯びてきそうです。
人間と遜色のない対話速度。
ただ、感情表現や効果音のタグ指定は、実際の業務フローへ組み込む設計の難易度がちょっと高そうです。まずは2週間の割引期間を利用して、自社の問い合わせ対応でどの程度スムーズに会話が成立するかをテストしてみるのが賢い判断だと思います。年末にかけて各社のAIエージェント製品で、この新モデルがどこまで採用されるかを見届けたいところです。
誰に関係するか
電話窓口や自動受付を運用している人は、発話の遅延が少ない自然な音声対話システムを構築できるようになります。
出典: ElevenLabs ↗


