Gemini、音声合成モデル「3.8 Flash TTS」を発表 独自音声の作成や大規模展開に対応
- Google DeepMindがテキストから音声を生成する「Gemini 3.8 Flash TTS」を公開しました。
- 効率と規模を重視した「Gemini 3.8 Flash-Lite TTS」も用意されています。
- 独自のアクセントを持つ声の作成や、既存の音声ライブラリの利用が可能です。

Google DeepMindは、テキスト読み上げモデルの「Gemini 3.8 Flash TTS」を発表しました。独自の音声を設計して運用できる仕組みを提供します。
「Gemini 3.8 Flash TTS」では、特有のアクセントや特徴を備えた独自の声を設計できます。話し手の個性に合わせた音声の作成が可能です。
あわせて登場した「Gemini 3.8 Flash-Lite TTS」は、効率と大規模な運用を重視したモデルです。自身で作成した音声スタイルだけでなく、実運用向けに用意された幅広いライブラリからも選択できます。
用途に合わせて音声を使い分けられます。自社サービス向けに独自の音声案内を用意したい場面や、既存の音声素材を使って大量の音声を配信したい場面で役立ちます。
ざっくり言うと、文章を自然な声で読み上げてくれる新しい仕組みです。たとえるなら、自社の受付専用に声のトーンを調整した案内係を雇うような感覚で、好みの話し方や訛りを持った声を作れます。また、すでにある豊富な声のカタログから選んで、たくさんの音声を素早く届ける使い方もできます。

表現力を追求するモデルと、処理効率を重視した軽量モデルを最初から揃えて提示してきました。筆者はこの棲み分けの早さに感心しました。用途ごとの使い分けがかなり明確です。
表現力か、量産か。
ブランドイメージを重視する企業なら専用の声を作り込み、コールセンターの自動応答のように配信規模を求める現場なら軽量版を選ぶ流れになりそうです。次は日本語の自然なイントネーションにどこまで対応できるか、年内のアップデートで確かめたいところです。
業務で音声案内を作成している人は、用途に合わせて独自の声質設計や用意された音声ライブラリを活用できるようになります。

