GPT Transcribeは、OpenAI APIで利用できる高精度な音声認識モデルです。録音済み音声、ストリーミングされたファイル文字起こし、Realtimeセッションの発話ターンをテキスト化できます。文脈プロンプト、キーワードヒント、複数の言語ヒントを使えるため、会議、通話、取材、専門領域の音声、複数言語が混ざる会話の文字起こしに向いています。料金は分単位の従量課金で、開発者が自社サービスへ組み込みやすいAPI型のツールです。
バッチ文字起こしの単価破壊役です。録音済みファイル1分あたり$0.0045と前世代から25%下がり、会議音声やコールログを大量に流し込んでも費用が読めます。
編集部レビューの全文 >
