Riffusion (音楽生成モデル)
読み: りふゅーじょん
最終更新: 2026-07-28・AI PICKS編集部
定義
Riffusionとは、音声波形をスペクトログラム画像に変換し、画像生成モデルの技術(Stable Diffusion系の拡散モデル)を応用して音楽を生成するAIモデルのこと。
Riffusion (音楽生成モデル)とは — 詳しく解説
Riffusionは、画像生成モデルであるStable Diffusionを音声のスペクトログラム画像に転用学習させることで、テキストプロンプトから音楽を生成する手法として2022年末に登場したとされる。生成した画像を音声波形に逆変換する仕組みのため、他の専用音楽生成モデルと比べて生成時間が短く動作が軽量な点が特徴とされる。一方で2026年時点の実運用では、長尺の楽曲や複雑な展開を持つ曲の生成には向かず、数秒〜十数秒のループ素材やBGMの下地作り用途にとどめて使われることが多いとされる。商用利用では学習データの著作権リスクや生成物の権利関係が整理しきれていない点が現場での懸念として挙げられる。コスト面ではオープンソース実装のためAPI利用料自体は低く抑えられるが、実運用に組み込む場合は音質補正や後処理の工数が別途かかる点を踏まえた選び方が求められる。
Riffusion (音楽生成モデル)の使用例
- 「jazz piano loop, calm, lo-fi」のようなプロンプトを入力し、数秒間のスペクトログラム画像を生成してループ音源に変換する使い方が知られている。
- 2つのプロンプト間でスペクトログラムを補間し、曲調がなめらかに変化するループを作る使い方が公開デモで紹介されている。
Riffusion (音楽生成モデル)に関連するAIツール
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1113語以上を体系的に整理しています
辞典トップへ