AI PICKS
新登場Google DeepMind Blog公式発表36分前

Google、Gemini 3.5 Transcribeを発表 85超の言語を自動検出

結論(先に3行)
  1. Google DeepMindがGemini 3.5 Transcribeを発表しました。
  2. リアルタイムと録音音声向けの2つのAPIで提供します。
  3. 85超の言語検出や最大3人の話者識別に対応します。
画像: Google DeepMind Blog

Google DeepMindは2026年8月26日、音声テキスト変換モデル「Gemini 3.5 Transcribe」を発表しました。自然な発話を、正確で整った書式付きテキストへ変換するモデルです。

開発者はGemini APIを通じて、Google AI StudioとGemini Enterprise Agent Platformで利用できます。Live APIではgemini-3.5-transcribe-liveを使い、サブ秒レイテンシの双方向ストリーミングを提供します。Interactions APIではgemini-3.5-transcribeを使い、録音音声や会議、通話ログを処理します。

機能面では、言い直しの処理、フィラー語の削除、自動整形、カスタム語彙への対応を備えます。Artificial Analysisの測定では、平均Word Error Rateはストリーミングで4.0%、非ストリーミングで2.6%です。

85超の言語を自動検出して文字起こしし、地域アクセントや多様な方言も扱います。録音音声では単語単位のタイムスタンプと最大3人の話者識別に対応し、3人を超える話者の対応は実験的です。前モデルChirp 3と比べ、最終文字起こしまでの時間は70%改善しました。

誰に関係するか

音声エージェント、リアルタイム字幕、会議や通話ログ分析を開発する人に関係します。

出典: Google DeepMind Blog

このニュースのツールAIチャットボット
Gemini icon
Gemini4.65最低料金¥0〜マルチモーダルGoogle連携検索
関連ニュースニュース一覧 >
法人の方へGeminiの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。