GPT-SoVITSは、少ない音声データで声を再現するFew-Shot音声変換・音声合成のWebUIです。GitHubで公開されているオープンソースソフトウェアで、ライセンスはMITです。

主な機能

Zero-Shot TTSでは5秒の音声サンプルを与えるだけで、入力したテキストをその声で読み上げられます。Few-Shot TTSでは1分ほどの学習データでモデルを微調整し、声の再現度を上げられます。対応言語は英語、日本語、韓国語、広東語、中国語です。WebUIには音声と伴奏(BGM)の分離、学習用音声の自動分割、テキストのラベリングといった前処理ツールがまとまっており、データセット作りからGPT/SoVITSモデルの学習、推論までを一つの画面で進められます。モデルはV2、V3、V4、V2Proと更新が続き、V4はネイティブに48kHzの音声を出力します。

誰に向くか

動画のナレーションやゲームのキャラクター音声を、自分の声や許諾を得た声で作りたい個人クリエイター、ローカル環境でボイスクローンを試したい開発者に向きます。Windowsでは統合パッケージを解凍してgo-webui.batを起動するだけで使い始められ、LinuxとmacOSではconda環境にインストールします。DockerイメージやColab用のノートブックも用意されています。

注意点

学習にはGPUがあると有利です。MacのGPUで学習したモデルは品質が大きく落ちるため、当面はCPUでの学習が推奨されています。ユーザーマニュアルは中国語と英語です。他人の声を無断で複製すると権利侵害になりうるため、使う声の許諾は利用者が確認する必要があります。