AI PICKS
AI用語辞典音声・音楽

Riffusion (音楽生成モデル)

読み: りふゅーじょん

最終更新: 2026-07-28・AI PICKS編集部

定義

Riffusionとは、音声波形をスペクトログラム画像に変換し、画像生成モデルの技術(Stable Diffusion系の拡散モデル)を応用して音楽を生成するAIモデルのこと。

Riffusion (音楽生成モデル)とは — 詳しく解説

Riffusionは、画像生成モデルであるStable Diffusionを音声のスペクトログラム画像に転用学習させることで、テキストプロンプトから音楽を生成する手法として2022年末に登場したとされる。生成した画像を音声波形に逆変換する仕組みのため、他の専用音楽生成モデルと比べて生成時間が短く動作が軽量な点が特徴とされる。一方で2026年時点の実運用では、長尺の楽曲や複雑な展開を持つ曲の生成には向かず、数秒〜十数秒のループ素材やBGMの下地作り用途にとどめて使われることが多いとされる。商用利用では学習データの著作権リスクや生成物の権利関係が整理しきれていない点が現場での懸念として挙げられる。コスト面ではオープンソース実装のためAPI利用料自体は低く抑えられるが、実運用に組み込む場合は音質補正や後処理の工数が別途かかる点を踏まえた選び方が求められる。

Riffusion (音楽生成モデル)の使用例

  • 「jazz piano loop, calm, lo-fi」のようなプロンプトを入力し、数秒間のスペクトログラム画像を生成してループ音源に変換する使い方が知られている。
  • 2つのプロンプト間でスペクトログラムを補間し、曲調がなめらかに変化するループを作る使い方が公開デモで紹介されている。

Riffusion (音楽生成モデル)に関連するAIツール

関連用語

音声・音楽」の他の用語

AI用語辞典をすべて見てみませんか

12カテゴリ・1113語以上を体系的に整理しています

辞典トップへ