Gradiumは、テキスト読み上げ、音声認識、ボイスクローンなどのリアルタイム音声AIを、開発者向けにAPIで提供するプラットフォームです。低遅延を重視しており、最新のテキスト読み上げモデルはベータ版で50ミリ秒未満の遅延をうたっています。
主な機能
- Text-to-Speech: テキストを自然な音声に変換します
- Speech-to-Text: 音声をすぐに文字に起こします
- Live Translation: 話した声をリアルタイムで別の言語の音声に変換します
- Voice Cloning: 手軽なインスタントクローンと、プロ向けのクローンを選べます
- Voice Design: テキストの説明から新しい声を作れます
- On-Device TTS: オフラインでも動く端末内の音声合成です
このほか、音声エージェントをその場で試せるデモや、1つのプロンプトから音声エージェントを組み立てるGradbot、利用者が作ったアプリを集めたギャラリーも用意されています。
向いている用途
コールセンターの自動応答や音声アシスタントなど、応答の遅れが体験を左右するサービスの開発に向きます。相手や文脈に応じて声を切り替える音声エージェントの作り方も、公式ブログで解説されています。
料金と注意点
料金はSaaSのサブスクリプションで、詳細は問い合わせです。AWS Marketplace経由での導入にも対応します。公式サイトには日本語版があります。議事録の作成や共有までを備えた完成品のアプリではなく、自社のサービスに組み込むためのAPIである点は押さえておきましょう。


