特徴

OpenAIが開発したオープンソースの自動音声認識(ASR)モデル。68万時間の多言語・マルチタスク教師ありデータで学習されており、英語に加えて日本語を含む多言語の文字起こし、音声からの英訳に対応する。tiny/base/small/medium/largeの5サイズに加え、高速版のturboを用意し、用途に応じて精度と速度を選べる。

提供形態

モデルとコードはMITライセンスのオープンソースとして無償公開されており、GitHubから取得して自前のGPU/CPU上でローカル実行できる。料金プランという概念自体が存在せず、ローカル実行は完全無料。機密性の高い音声データを外部に出さず処理したい開発者・研究者に向く。

API利用

自前インフラを持たずに使いたい場合は、OpenAI APIでwhisper-1モデルを$0.006/分(1秒単位の課金)で利用できる。ローカル実行の無料・自由度とAPI利用の手軽さを、用途に応じて使い分けられる。