Sunoの発表内容
音楽生成AIのSunoは、話し言葉と背景音楽をまとめて生成する新機能「Speech」のベータ版を公開しました。Webブラウザやモバイルアプリから全ての利用者が試せます。
この機能は、入力した文章に合わせてオリジナルの背景音楽と話し声を同時に作り出します。利用者はアイデアや詩などの文章を入力し、声の調子や音楽の雰囲気を指定して音源を出力します。メッセージの朗読や子どもの読み聞かせ、瞑想用の音声などへの活用を想定しています。
提供形態は公開ベータ版となります。開発チームによると、発音のアクセントが途中で変わったり、不自然な間が生じたりする挙動が確認されています。利用者の反応を見ながら音質や挙動の改善を継続する方針です。
ナレーションと劇伴の制作を個別に手配していた業務では、文章の指定だけで雰囲気をつかむ試作が素早く行えます。企画用の音声モックアップや動画のガイド音声を手軽に用意したい場面で役立ちます。
つまり、どういうこと?
ざっくり言うと、朗読劇の台本を渡すだけで、声優の声と後ろで流れるBGMを同時に録音して仕上げてくれる仕組みです。
これまで別々に用意して重ねていたナレーションと音楽を、ひとまとめの音源としてすぐに出力できます。
編集部の見方

音楽生成からの脱皮です。
ただ、公式発表でアクセントの乱れや過剰な間といった粗さを隠さず認めている点に、筆者は好感を持ちました。これまでは音声合成と音楽生成を別々のソフトで組み合わせていたため、同時に出力できる手軽さは重宝しそうです。完成した作品を作るというよりは、企画の初期段階で動画の雰囲気を素早く確かめる用途で威力を発揮すると思います。
一方、現時点では英語での挙動が中心のため、日本語の発音や感情表現にどこまで対応できるかはちょっと未知数です。まずは年内のアップデートで多言語対応や声のバリエーションがどこまで広がるかを見ておきたいところです。
誰に関係するか
ナレーションや朗読の音源を作成している人は、背景音楽を含めた音声トラックを文章の入力だけで同時に生成できるようになります。
出典: Suno ↗/ The Verge AIも報道


