Gradiumは、テキスト読み上げ、音声認識、ボイスクローンなどのリアルタイム音声AIを、開発者向けにAPIで提供するプラットフォームです。低遅延を重視しており、最新のテキスト読み上げモデルはベータ版で50ミリ秒未満の遅延をうたっています。

主な機能

  • Text-to-Speech: テキストを自然な音声に変換します
  • Speech-to-Text: 音声をすぐに文字に起こします
  • Live Translation: 話した声をリアルタイムで別の言語の音声に変換します
  • Voice Cloning: 手軽なインスタントクローンと、プロ向けのクローンを選べます
  • Voice Design: テキストの説明から新しい声を作れます
  • On-Device TTS: オフラインでも動く端末内の音声合成です

このほか、音声エージェントをその場で試せるデモや、1つのプロンプトから音声エージェントを組み立てるGradbot、利用者が作ったアプリを集めたギャラリーも用意されています。

向いている用途

コールセンターの自動応答や音声アシスタントなど、応答の遅れが体験を左右するサービスの開発に向きます。相手や文脈に応じて声を切り替える音声エージェントの作り方も、公式ブログで解説されています。

料金と注意点

料金はSaaSのサブスクリプションで、詳細は問い合わせです。AWS Marketplace経由での導入にも対応します。公式サイトには日本語版があります。議事録の作成や共有までを備えた完成品のアプリではなく、自社のサービスに組み込むためのAPIである点は押さえておきましょう。