Stable Audio (音楽・効果音生成)
読み: すてーぶるおーでぃお
最終更新: 2026-07-30・AI PICKS編集部
定義
Stable Audioとは、Stability AIが開発したテキストから音楽・効果音を生成できるAIモデルのこと。オープンウェイト版と商用API版がある。
Stable Audio (音楽・効果音生成)とは — 詳しく解説
Stable Audioは、Stability AIが開発したテキストプロンプトから音楽・効果音・環境音を生成する拡散モデル系の音声生成AIで、オープンウェイト版のStable Audio Openと商用版のStable Audio 2が併存する。業界標準としては拡散モデルによる波形直接生成方式が広く採用されており、著作権的にクリーンな学習データを使う点が競合との差別化要素とされる。2026年時点の実運用では、生成できる尺の上限やライセンス範囲(商用利用可否・クレジット表記の要否)がプランごとに細かく分かれており、契約内容の確認を怠ると公開後に差し替えが必要になる落とし穴がある。コスト感は無料枠+従量課金のAPI利用が中心で、歌詞付き楽曲が主戦場のSunoやSOUNDRAWとは棲み分けが必要。現場での選び方としては、BGM・効果音などインスト主体の短尺素材が目的ならStable Audio、歌モノが欲しいなら他ツールを選ぶのが相場感に合った判断とされる。
Stable Audio (音楽・効果音生成)の使用例
- 和風カフェのBGMに合う、静かなピアノとアンビエントの15秒ループを生成するプロンプト例。
- 雨が降る森の環境音に鳥の鳴き声を重ねた30秒の効果音を生成するプロンプト例。
Stable Audio (音楽・効果音生成)に関連するAIツール
関連用語
「音声・音楽」の他の用語
AI 音楽生成サービス。 歌詞 + ジャンル指定で 完成楽曲を 1 分で生成。
OpenAI のオープンソース音声認識モデル。 99 言語対応、 日本語精度も高い。
AI 音声生成のトップサービス。 自分の声をクローンして 多言語ナレーションに使える。
TTS(音声合成)とは、テキストデータを人間らしい音声に変換するAI技術のこと。ナレーション・コールセンター・音声UIなど幅広い用途で使われ、2026年現在は人間と聞き分けにくい品質が標準となっている。
ASR(Automatic Speech Recognition・自動音声認識)とは、人間の音声をテキストへ自動変換する技術のこと。深層学習モデルの普及で精度が飛躍的に向上し、文字起こし・音声コマンド・翻訳など幅広い用途で使われる。
ボイスクローンとは、数秒〜数分の音声サンプルから特定人物の声質・話し方・抑揚を高精度に再現するAI音声合成技術のこと。
AI用語辞典をすべて見てみませんか
12カテゴリ・1213語以上を体系的に整理しています
辞典トップへ