RVC WebUIは、RVC-Projectが公開している、シンプルで使いやすい声質変換(ボイスチェンジャー)のためのオープンソースフレームワークです。RVCはRetrieval-based Voice Conversionの略で、クリムゾンテクノロジーのVoidol3Rのような商用のボイスチェンジャーも、この方式に対応しています。

主な機能

WebUIから声質モデルの学習と推論ができ、比較的性能の低いGPUでも高速かつ簡単に学習できます。少量のデータセットでも比較的よい結果が得られ、10分以上のノイズの少ない音声が推奨されています。Top1検索で生の特徴量を学習データの特徴量に置き換えてトーンリーケージを減らす仕組み、ピッチ抽出アルゴリズムRMVPE、モデルを融合して声を混ぜるckpt merge、人の声とBGMを素早く分離するpymss/MSSTモデルを備えます。リアルタイム音声変換用の画面もあり、端から端までの遅延は170ms、ASIO対応の入出力デバイスを使えば90msまで縮められますが、ハードウェアドライバーのサポートに大きく左右されます。

導入と注意点

MITライセンスで無料で使えます。現行版はPython 3.12 x64が対象で、Ubuntu 24.04が推奨され、Windowsにも対応します。NVIDIA製GPUのほか、AMD・Intel環境やCPUでも動きます(WindowsではDirectML)。学習済みモデルはHugging Faceから取得して決まったフォルダ構成に配置する必要があり、コマンド操作に慣れていない人には導入の手間があります。WebUIは日本語表示に対応しています。基底モデルは著作権侵害を心配せず使えるよう、オープンソースのデータセットで学習されていますが、他人の声で学習したモデルを使う場合は、声の持ち主の権利に配慮が必要です。