Whisperで文字起こしをするなら、PCにPythonとffmpegを入れて whisper 音声.mp3 --language ja を1行実行するのが最初の一手です。これだけで、音声ファイルと同じ場所にテキストと字幕ファイルができあがります。

録音データはあるのに、書き起こしに何時間も取られていませんか。インタビュー1本を手で起こすと、半日がまるごと消えます。

Whisperはその作業を、無料かつ自分のPCの中だけで片づけられる道具です。ただ「黒い画面でコマンドを打つ」段階でつまずく人が多いのも事実。そこで以下では、ローカルで動かす手順を順番どおりに並べます。途中で詰まったときの逃げ道として、ノーコードのクラウド型サービスも比べておきます。


Whisperとは?無料で使える音声認識AIの正体

Whisperとは?無料で使える音声認識AIの正体

Whisperとは、OpenAIが2022年9月22日に公開した音声認識モデルです。音声を聞き取って文字に起こし、英語への翻訳もこなします。

特徴は大きく3つあります。

  • 人が書き起こした正解つきの音声、約68万時間で学習している
  • 最新版のLarge v3は99言語に対応し、日本語もその中に入る
  • プログラムがオープンソースで公開されていて、誰でも無料で動かせる

2025年9月には、AIの処理性能を測る業界共通のテスト「MLPerf Inference v5.1」で、音声認識部門の公式ベンチマークに採用されました。公開から3年以上たっても、業界の物差しとして使われ続けている。ここが強みです。

もちろん弱点もあります。英語だけの精度では、後から出てきたモデルに抜かれたという評価も出ています。それでも「無料」「オフライン」「派生ツールの多さ」の3点がそろう選択肢は、いまも見当たりません。日本語の文字起こしでも、実用の第一候補であることは変わらないのです。

中身は同じWhisperでも、使い方は3通りあります。自分に合う道を先に決めておくと、後の手順で迷いません。


編集部のおすすめ

ZoomやGoogle Meetの会議を文字にして、要点とやることを自動でまとめます。

3つのやり方のどれを選ぶ?ローカル・API・ノーコードの違い

3つのやり方のどれを選ぶ?ローカル・API・ノーコードの違い

Whisperを使う道は、PCで動かす「ローカル」、プログラムから呼ぶ「API」、アプリに任せる「ノーコード」の3つです。費用と手間と機密性のどれを優先するかで決まります。

APIとは、他のソフトからAIを呼び出す窓口のこと。3つの違いを表にまとめました。

やり方費用必要なスキル音声の送り先向いている人
ローカル実行無料(PCと電気代のみ)コマンドを数行打てる自分のPCの外に出ない機密音声や長時間の音声を大量に回す人
OpenAI API従量課金(whisper-1は1分0.006ドル)短いプログラムを書けるOpenAIのサーバー自社のツールや業務フローに組み込みたい人
ノーコード(Nottaなど)各サービスの料金プラン不要各社のサーバー会議の議事録が目的の人、PCが非力な人

つまり、お金をかけずに機密も守りたいならローカル一択です。逆に「手順を覚える時間がもったいない」なら、最初からノーコードに振り切るほうが結果的に安く済みます。

判断に迷う人は、この3つの質問で決めてください。

  • 音声を社外のサーバーに送れない事情がある → ローカル
  • 月に何十時間も文字起こしする → ローカル(API料金も積み上がるため)
  • ZoomやTeamsの会議を毎回記録したい → ノーコード
  • 自作のアプリに文字起こし機能を入れたい → API

ローカルを選んだ人は、そのまま準備物の確認に進みましょう。


Notta icon
この記事で紹介 / AI音声・文字起こし4.40無料あり日本語◎最低料金 ¥0〜

有料にすると 1回5時間・月1,800分まで文字起こし(プレミアム ¥1,185/月(年間一括払い、総額¥14,220・税込))

ローカルで動かす前に準備するもの

ローカル実行に必要なのは、Python、ffmpeg、Whisper本体の3つです。GPU(画像処理用の高速な半導体)はあれば速くなりますが、無くても動きます。

それぞれの役割と入手方法は次のとおりです。

準備するもの役割入手方法
PythonWhisperを動かす土台のプログラミング言語python.orgから入手、MacはHomebrewでも可
ffmpegmp3やmp4などを読み込む変換係Mac は brew install ffmpeg、Windows は scoop install ffmpeg
openai-whisperWhisper本体pip install -U openai-whisper
GPU(任意)処理を大幅に速くするNVIDIA製GPUならCUDAで高速化できる
ディスクの空きモデルの保存先大きいモデルは数GBあるので余裕を持たせる

つまり、必須なのは上の3行だけ。GPUとディスクは「速さ」と「大きいモデルを使えるか」に効いてきます。

Macを使っている人は一点だけ注意が必要です。Apple Silicon搭載のMacでは、本家のPython版よりも後で触れるwhisper.cppのほうが速く動きます。とりあえず動かしてみる段階では本家で問題ありません。遅さが気になったら乗り換えてください。

Pythonのバージョンは、公式のGitHubページに書かれた動作確認済みの範囲から選ぶのが安全です。最新版を入れると、依存するライブラリが追いつかずエラーになることがあります。

準備物がそろったら、いよいよ手順です。


手順|Python版Whisperで音声ファイルを文字起こしする

本家のWhisperは、インストール1行と実行1行で文字起こしまで終わります。ここではMacとWindowsの両方で使える手順を順に並べます。

ステップ1:Pythonを入れる

python.orgからインストーラーを入手して実行します。Windowsでは、最初の画面で「Add python.exe to PATH」に必ずチェックを入れてください。ここを飛ばすと、後で「コマンドが見つからない」と怒られます。

入ったかどうかは、ターミナル(Windowsはコマンドプロンプト)で確かめます。

python --version

バージョン番号が表示されればOK。

ステップ2:ffmpegを入れる

MacならHomebrew、WindowsならScoopを使うのが手っ取り早い方法です。

# Mac
brew install ffmpeg

# Windows(Scoop導入済みの場合)
scoop install ffmpeg

ffmpeg -version で情報が出れば準備完了です。

ステップ3:Whisper本体を入れる

Python付属のパッケージ管理ツールpipで入れます。

pip install -U openai-whisper

プロジェクトごとに環境を分けたい人は、先に仮想環境を作っておくと後々の衝突を防げます。

ステップ4:1行で文字起こしする

音声ファイルがあるフォルダに移動し、次のコマンドを打ちます。

whisper meeting.mp3 --model large-v3 --language ja

初回だけ、指定したモデルのダウンロードが走ります。大きいモデルほど時間がかかるので、回線の速い場所でどうぞ。2回目以降はダウンロード済みのモデルが使われます。

--language ja は省略もできます。ただし省略すると冒頭の数十秒から言語を推測するため、BGMや英語の挨拶で始まる音声だと判定を外すことがあります。日本語とわかっているなら指定一択です。

ステップ5:出力ファイルを確かめる

何も指定しなければ、音声と同じ場所に5種類のファイルができます。

  • .txt:テキストだけ。議事録や記事の下書き向け
  • .srt と .vtt:時刻つきの字幕ファイル。動画編集ソフトやYouTubeに読み込める
  • .tsv と .json:時刻と文字のデータ。プログラムで加工したい人向け

必要な形式だけ欲しい場合は --output_format srt のように指定します。保存先を変えるなら --output_dir 出力フォルダ名 です。

手順自体はここまで。仕上がりの良し悪しは、次に決めるモデルの大きさでほぼ決まります。


モデルサイズはどれを選べばいい?

迷ったら、GPUありのPCはlarge-v3、CPUだけのPCはsmallから試すのが答えです。大きいモデルほど精度が上がり、そのぶん処理時間とメモリ消費が増えます。

Whisperにはtinyからlargeまで複数のサイズがあります。性格の違いをざっくり並べました。

モデル速さ日本語の精度向いている使い方
tiny◎△動作確認、内容をざっと知りたいとき
base◎△短いメモ音声の下見
small○○CPUだけのPCでの普段使い
medium△○CPUでも時間をかけて質を取りたいとき
large-v3△◎GPUありのPC、記事化や字幕など仕上げ用途

つまり、日本語を「そのまま使える文章」にしたいならlarge-v3が基準です。small以下は、固有名詞や言い回しの崩れを後で直す手間が増えます。

実際の運用では、2段構えが地味に効きます。tinyやsmallで数分だけ試し、話者の声や録音状態に問題がないかを確認する。問題なければlarge-v3で本番をかける。長い音声でいきなりlarge-v3を回し、数時間後に「マイクが遠くて全滅」と気づく事故を防げます。

モデルを決めても、日本語特有のクセは残ります。そこを埋めるのがオプションの指定です。


日本語の精度を上げる5つの設定

日本語の仕上がりは、言語の指定、指示文、繰り返し対策、音質、派生モデルの5点で大きく変わります。どれもコマンドに一言足すか、下準備をするだけです。

1. 言語を明示する(--language ja) 前のステップでも触れた基本です。判定ミスで英語やローマ字の結果が出る事故を防ぎます。

2. 最初の指示文で句読点と固有名詞を教える(--initial_prompt) Whisperの日本語は、句読点が抜けたまま延々と続くことがあります。そこで、冒頭に「こういう文章を書いてほしい」というお手本を渡します。

whisper meeting.mp3 --model large-v3 --language ja \
  --initial_prompt "以下は、会議の書き起こしです。句読点を付けて書きます。参加者は佐藤、田中です。"

句読点入りの例文を渡すと、出力にも句読点が付きやすくなります。社名や製品名、人名もここに入れておくと、表記ゆれが減ります。

3. 同じ文の繰り返しを止める(--condition_on_previous_text False) 無音やBGMが続く区間で、同じ一文を何十回も繰り返すのはWhisperの有名なクセです。直前の結果を次の推測に使う仕組みが、悪い方向に連鎖するのが原因。このオプションで連鎖を切ると、暴走がかなり収まります。

4. 音質を先に整える 雑音や反響の多い音声は、どのモデルでも崩れます。録音の段階でマイクを口元に近づけるのが一番。録り直せない音声なら、ノイズ除去ツールを通してから文字起こしにかけます。無料で試せる方法はAdobe Podcast Enhanceの使い方|無料制限と声の歪みを防ぐ代替5選にまとめてあり、声が歪む失敗を避けるコツも載っています。

5. 日本語向けの派生モデルを使う 本家以外にも、日本語の音声で追加学習したkotoba-whisperや、時刻合わせと話者分離を足したWhisperXがあります。WhisperXは、無音区間を先に取り除く仕組みを持つため、長時間の音声でも安定しやすいのが強み。会話やニュースのように話者が入れ替わる音声では、こちらのほうが後処理が楽です。

ここまでの設定で精度はかなり上がります。残る課題は「速さ」です。


速く回したいならfaster-whisperとwhisper.cppが候補

処理の遅さが気になったら、WindowsやLinuxはfaster-whisper、Macはwhisper.cppに乗り換えるのが近道です。どちらも中身はWhisperのモデルなので、精度をほぼ保ったまま速くなります。

ここまでの整理:準備物は Python・ffmpeg・Whisper本体の3つ。モデルは GPU ありなら large-v3、CPU だけなら small から。日本語は --language ja と --initial_prompt の2つを足すだけで仕上がりが変わります。

faster-whisperは、Whisperを高速な推論エンジンの上で動かし直したライブラリです。メモリの消費も抑えられるため、GPUのメモリが少ないPCでも大きいモデルを載せやすくなります。使い方はPythonで数行です。

from faster_whisper import WhisperModel

model = WhisperModel("large-v3", device="cuda", compute_type="float16")
segments, info = model.transcribe("meeting.mp3", language="ja", vad_filter=True)

for s in segments:
    print(f"[{s.start:.1f}s -> {s.end:.1f}s] {s.text}")

vad_filter=True は、声の無い区間を先に取り除く設定です。前の章で触れた「繰り返しの暴走」も起きにくくなります。GPUが無いPCでは device="cpu"、compute_type="int8" に変えれば動きます。

whisper.cppは、WhisperをC/C++で書き直したものです。Apple SiliconのMacでは、Apple純正の高速化機能を使って軽快に動きます。

コマンドも書きたくないMacユーザーには、Whisperを内蔵したアプリという道もあります。MacWhisperやAikoは、ファイルをドラッグするだけでPCの中で文字起こしが完結するタイプ。音声を外に出さない利点はそのままで、黒い画面を一度も開かずに済みます。

とはいえ、どの方法でもエラーはつきもの。よく出るものを先に押さえておきましょう。


つまずきやすいエラーと対処

ローカル実行で詰まる原因は、ほぼ「パスが通っていない」「ffmpegが無い」「メモリ不足」の3系統です。症状から原因を逆引きできるよう表にしました。

症状よくある原因対処
whisper: command not found と出るインストール先にパスが通っていないpython -m whisper 音声.mp3 で実行する。仮想環境なら有効化を確認
ffmpegが見つからないというエラーffmpegが未導入、またはパス未設定ステップ2をやり直し、ターミナルを開き直す
1時間の音声が終わらないCPUで大きいモデルを動かしているsmallに落とすかfaster-whisperに切り替える
CUDA out of memoryGPUのメモリ不足小さいモデルにする。faster-whisper の int8 で節約する
同じ文が延々と繰り返される無音やBGMの区間で連鎖が暴走--condition_on_previous_text False、無音除去を使う
句読点がほとんど付かない日本語出力のクセ--initial_prompt に句読点入りの例文を渡す

つまり、エラー文の最初の1行を読めば、たいていこの表のどれかに当てはまります。それでも直らない場合は、エラー文をそのままAIチャットに貼って聞くと解決が早いです。

もう一つ、見落としがちな落とし穴があります。Whisperの出力は「それっぽいけど違う」ことがある点です。AIがもっともらしい嘘をつく現象は文字起こしでも起き、聞き取れない箇所を勝手に補ってしまいます。数字、固有名詞、発言の否定・肯定は、公開前に音声と突き合わせてください。

エラー対応が面倒になってきた人は、APIに切り替える手もあります。


この記事のツールを比べる

OpenAI APIで使うと料金はいくら?

OpenAI APIでwhisper-1を使う場合、料金は1分0.006ドル、1時間で0.36ドルです。安さを優先するなら、半額のgpt-4o-mini-transcribeも選べます。

OpenAIの料金ページの掲載内容によると(2026年8月時点)、文字起こし向けのモデルは次のとおりです。

モデル1分あたり特徴
whisper-10.006ドル従来のWhisperをAPIで使う形。時刻つき出力に対応
gpt-4o-mini-transcribe0.003ドルwhisper-1の半額。コスト優先の大量処理向け
gpt-transcribe0.0045ドル新しい系統の文字起こし専用モデル
gpt-4o-transcribe0.006ドル雑音やなまりのある難しい音声向け
gpt-4o-transcribe-diarize0.006ドル話者分離つき。会議やインタビュー向け

つまり、月に10時間程度ならwhisper-1でも数ドルで収まります。高いか安いかは、PCを長時間ふさぐ手間と比べて決めてください。最新の料金と条件は、OpenAIの料金ページで確認するのが確実です。

呼び出し方はPythonで数行。APIキーを環境変数に設定しておけば、次のコードで動きます。

from openai import OpenAI

client = OpenAI()
with open("meeting.mp3", "rb") as f:
    result = client.audio.transcriptions.create(
        model="whisper-1", file=f, language="ja"
    )
print(result.text)

注意点は2つあります。1回に送れるファイルサイズには上限があるので、長い録音は分割してから送ります。もう一つは、音声がOpenAIのサーバーに送られる点。社外秘の会議を扱うなら、社内の規定と照らし合わせてから使いましょう。

ChatGPTの画面に音声を渡す方法とどちらが得か迷ったら、WhisperとChatGPTの違いを比較|精度・コスト・用途別の使い分けが判断の近道になります。精度とコストの差を用途別に整理してあります。

ここまではすべて「自分で手を動かす」道でした。手を動かしたくない人の選択肢に移ります。


ノーコードで済ませるなら?Nottaなどクラウド型の選び方

コマンドを一切打たずに済ませたいなら、ブラウザやスマホで完結するクラウド型の文字起こしサービスが答えです。中でも会議の記録が目的なら、Nottaが有力な選択肢に入ります。

Nottaは、録音したファイルのアップロードやその場での録音から文字起こしできるクラウド型サービスです。Web会議に参加して記録を取る機能や、AIによる要約、チームでの共有もそろっています。Whisperのローカル実行で必要だった準備物は何も要りません。無料プランも用意されていて、上限や有料プランの条件はNotta公式サイトで確認できます。

公開されている機能から見ると、向き不向きははっきりしています。

Nottaが向いている人

  • ZoomやGoogle Meetの会議を、毎回そのまま議事録にしたい人
  • 文字起こしの結果をチームで共有・編集したい人
  • PCのスペックが低く、ローカルで大きいモデルを動かせない人
  • スマホで録ってすぐテキストにしたい人

Nottaが向かない人

  • 音声を社外のサーバーに送れない案件を扱う人
  • 月に何十時間もの音声を処理し、費用を最小にしたい人
  • ネットのない環境で文字起こしする必要がある人

会議の記録に絞った使い方は、Zoom文字起こしの3つの方法|無料設定・保存先・議事録化までで詳しく扱っています。Zoom標準の機能で足りるケースもあるので、有料プランを検討する前に一読しておくと無駄な出費を避けられます。

Notta以外も比べたい人は、AI音声・文字起こしカテゴリとAI会議・議事録カテゴリに候補がまとまっています。注目度で並べた一覧を見たいなら、AI音声・文字起こしのランキングが手早いです。

なお、「録音を後で起こす」より「話したそばから文字にしたい」人は、目的がそもそも違います。その用途なら音声入力ツールのほうが合っていて、Wispr Flow代替の音声入力ツール7選で日本語に強いものを比べています。

道具の候補がそろったので、用途ごとに一本化しておきましょう。


用途別のおすすめ早見表

やりたいことが決まっていれば、選ぶ方法も1つに絞れます。よくある6つの用途で整理しました。

用途おすすめの方法理由
インタビュー記事の書き起こしローカル(large-v3)精度重視で時間をかけられ、費用もかからない
YouTube動画の字幕づくりローカル(--output_format srt)時刻つき字幕がそのまま出る
社内会議の議事録Nottaなどクラウド型会議への参加から要約、共有まで一続き
自社アプリへの組み込みOpenAI API(gpt-4o-mini-transcribe)サーバー不要で、1分0.003ドルと安い
医療・法務など機密の音声ローカル(faster-whisperなど)音声が外部に一切出ない
外国語の動画を日本語で読みたいWhisperで書き起こし+翻訳ツールWhisperの翻訳機能は英語向けのみ

つまり、「機密」「大量」「字幕」のどれかに当てはまればローカル、「会議」ならクラウド型と覚えておけば外しません。

最後の行は見落とされがちなポイントです。Whisperの翻訳機能は、他の言語を英語に訳すためのもの。日本語にしたい場合は、書き起こした原文を翻訳ツールに渡します。候補はAI翻訳・多言語カテゴリで探せます。

書き起こした文章を逆に音声化する場面もあるでしょう。原稿をAIに読ませると読み間違いが気になりますが、AI音声の読み間違いを直す7つのコツのとおり、原稿の書き方を直すだけでかなり自然になります。


AI PICKS編集部の判定

迷っているなら、ローカルのWhisperから始めるのが正解です。無料で回数制限がなく、音声がPCの外に出ない。この3つを同時に満たす道は、ほかにありません。インストールはコマンド2行、実行は1行です。手間の割に見返りが大きく、長く付き合える道具と言い切れます。

モデルは、GPUがあればlarge-v3一択です。CPUだけのPCで本家を回すのは正直イマイチ。遅すぎて途中で投げ出しがちなので、faster-whisperかwhisper.cppに乗り換えてください。

一方、会議の議事録が主目的なら話は別です。録音、書き起こし、要約、共有まで一続きで済むNottaのようなクラウド型のほうが、トータルの手間は圧倒的に少なくなります。毎週の会議のたびにファイルを書き出してコマンドを打つ運用は、まず続きません。

APIは、自作ツールに組み込む人だけが選べば十分です。gpt-4o-mini-transcribeの1分0.003ドルは破格。ただ個人の文字起こしなら、ローカルで無料にできるものにお金を払う理由は薄いです。公開情報を突き合わせた見立てとしては、「普段はローカル、会議だけクラウド」の二本立てが最も無駄のない組み方です。


よくある質問(FAQ)

Q. Whisperは本当に無料で使えますか?

はい。オープンソース版はMITライセンスで公開されていて、ローカルで動かす限り料金はかかりません。回数や時間の上限もなく、かかるのはPCの電気代くらいです。有料になるのは、OpenAIのAPI経由で使う場合だけです。

Q. GPUが無いPCでもWhisperは動きますか?

動きます。ただしCPUだけでlarge-v3を動かすと、音声の長さ以上に時間がかかることもあります。smallから試すか、CPUでも速いfaster-whisperのint8設定を使うのがおすすめです。Macならwhisper.cppが軽快です。

Q. Whisperで話者を分けて文字起こしできますか?

Whisper単体には話者を分ける機能がありません。ローカルならWhisperXのような派生ツールを使います。APIなら話者分離つきのgpt-4o-transcribe-diarizeが選べます。会議用途なら、話者識別を備えたクラウド型サービスに任せるのも手です。

Q. 動画ファイル(mp4)をそのまま文字起こしできますか?

できます。ffmpeg が動画から音声を取り出してくれるので、whisper video.mp4 --language ja のように指定するだけです。字幕にしたいなら --output_format srt を付けると、動画編集ソフトに読み込める形で出力されます。

Q. 文字起こしの結果に句読点が付かないのはなぜですか?

Whisperの日本語出力には、句読点を省きがちなクセがあります。--initial_prompt に句読点入りの日本語の例文を渡すと、出力にも句読点が付きやすくなります。固有名詞をあわせて書いておくと、表記ゆれも減らせます。

Q. 会議の音声をWhisperに入れても情報漏えいしませんか?

ローカルで実行する場合、音声はPCの外に送られません。一方、OpenAI APIやクラウド型サービスを使うと、音声は各社のサーバーに送られます。社外秘の会議なら、社内規定と各社の利用規約を確認してから使ってください。

Q. Whisperと有料の文字起こしサービスは何が違いますか?

文字起こしの精度そのものより、周辺機能の差が大きいです。有料サービスは会議への自動参加、要約、共有、編集画面までそろっています。Whisperは書き起こしに特化した道具なので、編集や共有は自分で別のツールを組み合わせる必要があります。

次に読むならこれ:ローカルとChatGPTのどちらで起こすか、まだ決めきれていないならWhisperとChatGPTの違いを比較|精度・コスト・用途別の使い分けがおすすめです。精度とコストの差が用途別に並んでいるので、この記事で選んだ方法が正しいかをもう一度確かめられます。


あわせて見たいツール・カテゴリ