Stable Audio 3をComfyUIで使う方法|Small-Music・SFX・Mediumを実際に生成して検証

生成AI

⚠️ 注意: AI画像生成時は著作権・肖像権にご注意ください。商用利用前には各サービスの利用規約をご確認ください。当ブログは生成された画像に関する責任を負いかねます。

要約

Stable Audio 3はStability AIが開発した音声・音楽生成AIモデルで、2026年5月にComfyUI v0.22.0へのネイティブ対応が発表されました。効果音向けの「Small-SFX」、BGM・ループ向けの「Small-Music」、長尺楽曲向けの「Medium」の3種類があり、商用ライセンス済みデータで訓練されている点が特徴です。この記事ではHuggingFaceからのモデルダウンロード・ComfyUIへの配置・テンプレート起動の手順と、各モデルで実際に生成した音声サンプルをまとめました。

はじめに

AI音楽生成ツールといえばSunoやUdioが有名ですが、ComfyUIでローカル動作できるモデルとなると、まだ選択肢が少ないんですよね。

そんな中、2026年5月にStability AIが「Stable Audio 3」を発表し、同日ComfyUI v0.22.0でネイティブサポートが追加されました。テンプレートから1クリックで起動できて、以前のStable Audio Open(最大47秒)から大幅に進化し、最大約6分20秒の楽曲が生成できます。

実際に動かしてどんな音が出るのかを確かめてみたので、まとめます。

Stable Audio 3とは

Stable Audio 3は、すべて商用ライセンス済みのデータで訓練されたテキスト→音声生成モデルです。前世代のStable Audio Open(最大47秒)と比べて生成長が大幅に伸びていて、音楽的な構成力も向上しています。

ComfyUI v0.22.0以上に標準搭載されているので、カスタムノードの追加なしでそのまま使えます。

モチベル
Stable Audio 3って商用OKなの?
クーラット
Stability AI Community Licenseの条件内なら商用利用できるよ。テキストエンコーダのT5-GemmaはGoogleのモデルだけど、Gemma ToUも商用OKで、有害用途の禁止が主な制限だね。

3つのモデルの特徴

モデル ファイルサイズ 最大生成長 主な用途
Small-SFX 約2.3GB 2分(120秒) 効果音・アンビエンス・SE
Small-Music 約2.3GB 2分(120秒) BGM・ループ・短い楽曲
Medium 約7GB 約6分20秒(380秒) 長尺楽曲・本格的な音楽制作

Small-SFXとSmall-Musicはモデルサイズが同じで、訓練データと得意な用途が異なります。まず試すならSmall-Musicからがおすすめです。Mediumは高品質なぶん、ダウンロードと生成に時間がかかります。

ライセンスについて
Comfy-Org版はStability AI Community Licenseの再配布条項に基づいて公開されていて、ライセンス同意なしでダウンロードできます。ダウンロード後の利用は同ライセンスに従う必要がありますが、個人・法人問わず年間収益100万ドル未満であればコミュニティライセンス(無料)で商用利用できます。生成したコンテンツの著作権は利用者に帰属します。年間収益100万ドル以上になった場合はEnterpriseライセンスへの切り替えが必要で、超過後にそのまま利用を続けるとライセンスが自動終了します。詳細はライセンス全文を確認してください。テキストエンコーダのT5-GemmaにはGemma Terms of Useが適用されますが、こちらも商用利用は可能で、有害コンテンツ生成・違法利用などの禁止用途が制限の中心になっています。

ComfyUIへの導入手順

ComfyUI v0.22.0以上が必要です。まだアップデートしていない場合は、ComfyUI Managerの「Update All」で最新版にしておいてください。ComfyUIのインストール自体がまだの場合はComfyUIインストールガイドを参照してください。

1
HuggingFaceからモデルをダウンロードする

ComfyUI用には Comfy-Orgが公式リパックしたファイルを使います。stabilityai/ 直ではなく Comfy-Org/stable-audio-3 リポジトリからDLするのが正しい手順です。ライセンス同意は不要で、HuggingFaceのアカウントがあればそのままDLできます。

チェックポイント(使いたいモデルを選んでDL):

  • Small-Music(BGM・ループ向け):checkpoints/stable_audio_3_small_music.safetensors — 約2.3GB
  • Small-SFX(効果音向け):checkpoints/stable_audio_3_small_sfx.safetensors — 約2.3GB
  • Medium(長尺楽曲向け):checkpoints/stable_audio_3_medium.safetensors — 約7GB

テキストエンコーダ(別途DLが必要):

hfコマンドでまとめてDLするのが楽です。

# チェックポイント(例:Small-Music)
hf download Comfy-Org/stable-audio-3 \
  checkpoints/stable_audio_3_small_music.safetensors

# テキストエンコーダ(2つ)
hf download Comfy-Org/stable-audio-3 \
  text_encoders/t5gemma_b_b_ul2.safetensors

hf download Comfy-Org/Qwen3.5 \
  text_encoders/qwen3.5_2b_bf16.safetensors

HuggingFaceのComfy-Org/stable-audio-3リポジトリ

2
モデルとテキストエンコーダをComfyUIに配置する

ダウンロードしたファイルを以下の構成で配置します。フォルダは不要で、checkpoints/ 直下にファイルを置くだけです。

ComfyUI/
└── models/
    ├── checkpoints/
    │   ├── stable_audio_3_medium.safetensors
    │   ├── stable_audio_3_small_music.safetensors  ← Small-Music
    │   └── stable_audio_3_small_sfx.safetensors    ← Small-SFX
    └── text_encoders/
        ├── t5gemma_b_b_ul2.safetensors             ← sa_clip(全モデル共通)
        └── qwen3.5_2b_bf16.safetensors             ← qwen_clip

テキストエンコーダは models/text_encoders/ に配置する点に注意してください。チェックポイントと場所が違います。

ComfyUIのcheckpointsフォルダにStable Audio 3のモデルファイルをフラットに配置した状態

テキストエンコーダは models/text_encoders/ に入れます。

ComfyUIのtext_encodersフォルダにt5gemma_b_b_ul2とqwen3.5_2b_bf16の2ファイルを配置した状態

3
ComfyUIのテンプレートからワークフローを起動する

ComfyUIを起動(または再起動)して、左サイドバーのTemplateを開きます。カテゴリからAudioを選ぶと「Stable Audio 3」のテンプレートが表示されます。

ComfyUIのAudioカテゴリにあるStable Audio 3テンプレート一覧

テンプレートは「Stable Audio 3.0 Medium」と「Stable Audio 3.0 Medium Base」の2つがあります。Baseなしを選ぶのが正解です。

テンプレート モデル 違い
Stable Audio 3.0 Medium stable_audio_3_medium.safetensors use_reprompt あり。duration・seed・category指定可。こちらを使います
Stable Audio 3.0 Medium Base stable_audio_3_medium_base.safetensors ファインチューニング前の素モデル。通常は使いません

テンプレートをクリックするとワークフローが読み込まれます。

Stable Audio 3のComfyUIワークフロー全体図

ワークフローの基本設定:

  • モデル選択:読み込んだモデルフォルダを選択します
  • Prompt:生成したい音のテキスト説明を入力します
  • Duration(秒):生成したい長さを秒単位で指定します

設定が完了したら「Queue」をクリックして生成開始です。

実際に生成してみた

各モデルで実際に生成した音声サンプルをまとめました。環境はRTX 3070 8GB、2回目以降(キャッシュ有)の計測値です。

モデル 生成時間 音声の長さ(最大) 速度感
Small-Music 約9〜15秒 90秒(最大120秒) リアルタイムの6〜10倍速
Small-SFX 約5〜6秒 10〜30秒(最大120秒) リアルタイムの5〜6倍速
Medium 約38〜86秒 150〜380秒(最大380秒) リアルタイムの4倍速

Small-Musicで試してみた

まずSmall-Musicでいくつかのジャンルを生成してみました。RTX 3070 8GBで9〜15秒で生成できます。Mediumの約半分以下の速さですね。

Lo-fiヒップホップ系BGM(15.04秒で生成)

Lo-fi Hip Hop(Small-Music・90秒)

プロンプト: lo-fi hip hop, chill beats, relaxed mood, piano, vinyl crackle, 80bpm

シネマティック系(8.79秒で生成)

シネマティック(Small-Music・90秒)

プロンプト: cinematic, orchestral, emotional, strings, piano, building tension

ローファイらしい少しノイジーな質感が再現できていて、落ち着いた曲調でまったりできます。シネマティックはピアノの優しい旋律から始まり、オーケストラによる壮大な展開へと移っていきます。ヒーローが戦地に赴くような緊張感と高揚感がありますね。

Mediumで長尺トラックを試してみた

まずデフォルト設定(duration: 150秒)でトロピカルハウス系を生成してみました。

RTX 3070 8GB で 150秒の楽曲を約38〜48秒で生成できました。 初回47.95秒、2回目以降はモデルキャッシュが効いて37.85秒まで短縮できています。体感よりずっと速いんですよね。

Tropical House(Medium・150秒)

プロンプト: Tropical house track with marimba, steel drums, soft synths, smooth bass, layered percussion, and light piano riffs for sunny chill dance vibes

軽快な音楽とマリンバの旋律が心地いい仕上がりで、そのままBGMとして使えるクオリティでした。

日本語プロンプトでも生成できた

試しに日本語でプロンプトを書いてみたら、ちゃんとイメージ通りの音楽が生成できました。

ファンタジー民族音楽(Medium・150秒)

プロンプト: ファンタジー世界の穏やかな日常、民族楽器を使った軽快な音楽、明るく楽しい雰囲気

楽しげな音楽になっていて、ファンタジー世界に入り込んだようです。

戦闘曲も試してみました(40.06秒で生成)。

ファンタジー戦闘曲(Medium・150秒)

プロンプト: ファンタジー世界、戦闘曲、ドラムの重低音、エレキギター、シンバルのアクセント、緊張感のある旋律、BPM160

気持ちの昂るかっこいい戦闘曲になりました。楽器の指定を細かく追加するほど音色に幅が出てくるので、ゲームBGMを作りたい人には特におすすめです。

日本語プロンプトが使える
テキストエンコーダにQwen 3.5(多言語対応モデル)が使われているため、日本語のプロンプトでもそのまま生成できます。SunoやUdioと違って英語に翻訳しなくていいのは、地味に便利です。
use_reprompt 機能
ワークフローに use_reprompt というオプションがあります(デフォルト: ON)。入力プロンプトをモデルが内部で補完・整形してから生成する機能で、シンプルな書き方でも精度が上がりやすいです。reprompt_category で「Music」「SFX」など用途カテゴリを指定できます。

Small-SFXで効果音を試してみた

足音SE(6.31秒で生成 / duration: 10秒)

足音SE(Small-SFX・10秒)

プロンプト: footsteps on wooden floor, interior, realistic, close mic

雨のアンビエンス(5.34秒で生成 / duration: 30秒)

雨のアンビエンス(Small-SFX・30秒)

プロンプト: heavy rain, indoor atmosphere, ambient, no music

本当に階段を上っているような足音になっていて、SEとしてそのまま使えそうです。雨音はきれいな雨音に雷の音まで入っていて、再現度が高いですね。どちらも数秒で生成できるので、必要なSEをその場で量産できます。

プロンプトの書き方

ジャンル・楽器・ムード・テンポ・長さをコンマで並べると結果が安定しました。英語でも日本語でも動きます。

プロンプト構成の基本:

[ジャンル], [楽器/音色], [ムード], [テンポ/BPM]

用途別プロンプト例(英語):

用途 プロンプト例
動画BGM(落ち着き系) lo-fi hip hop, piano, chill, relaxed mood, 80bpm
ゲームSE(武器) sword slash, metallic, sharp, impact sound effect
アンビエンス forest ambience, birds, wind, morning, peaceful
シネマティック cinematic, orchestral, epic strings, emotional, building
シンセウェーブ synthwave, retro, 80s, electronic, pulsing bass

日本語プロンプト例:

用途 プロンプト例
ゲームBGM(ファンタジー・日常) ファンタジー世界の穏やかな日常、民族楽器を使った軽快な音楽、明るく楽しい雰囲気
ゲームBGM(バトル) ファンタジー世界、戦闘曲、ドラムの重低音、エレキギター、シンバルのアクセント、緊張感のある旋律、BPM160
和風アンビエンス 日本の神社、静かな雰囲気、琴と尺八、穏やかな自然の音
Duration(生成秒数)の指定
Small-MusicとSmall-SFXは最大120秒(2分)、Mediumは最大380秒(約6分20秒)です。390秒以上も生成はできますが末尾がぶつ切りになるため、380秒が実用上の上限です。長尺トラックでも380秒以内に収めるのがおすすめです。まず30〜90秒から試して、良い結果が出たら伸ばしていくといいと思います。

よくある疑問


QStable Audio 3は無料で使えますか?
A

モデル自体は無料でダウンロードできます。Comfy-Org経由であればライセンス同意も不要で、HuggingFaceのアカウントがあればそのままDLできます。商用利用についてはStability AI Community Licenseで詳細を確認してください。

QどのバージョンのComfyUIが必要ですか?
A

ComfyUI v0.22.0以上が必要です。ComfyUI Managerの「Update All」でComfyUI本体を最新版にアップデートすれば対応できます。

QGPUのVRAMはどれくらい必要ですか?
A

Mediumは RTX 3070 8GB(VRAM 8GB)で動作確認済みです。RTX 3070で150秒の楽曲が約48秒で生成できました。Small-Music・Small-SFXはより軽量なので、8GB以下でも動く可能性が高いです。CPUでも動作しますが、生成時間は大幅に長くなります。ローカルGPUがない場合はRunPodなどのクラウドGPUでも動作します。

Q生成した音声を商用利用できますか?
A

Stability AI Community Licenseの条件内であれば商用利用できます。年間収益100万ドル未満であればコミュニティライセンス(無料)で対応できます。生成したコンテンツの著作権は利用者に帰属します。テキストエンコーダのT5-GemmaにはGemma Terms of Useが適用されますが、こちらも商用利用は可能です。有害コンテンツの生成など禁止用途に抵触しなければ問題ありません。

Q前世代のStable Audio Openとどう違いますか?
A

最大生成長が約47秒から最大約6分20秒(Mediumの場合)へと大幅に伸びました。音楽的な構成力も向上していて、より長く一貫した楽曲が生成できます。また、商用ライセンス済みデータで訓練されている点も改善されています。

まとめ

Stable Audio 3はComfyUIへのネイティブ対応によって、カスタムノードなしでローカル音楽生成ができるようになりました。

  • Small-SFX:効果音・SE・短いアンビエンス向け
  • Small-Music:BGM・ループ素材・短い楽曲向け(まず試すならここから)
  • Medium:最大約6分の長尺楽曲向け、音楽的な構成力が高い

商用ライセンス対応と長尺生成は従来のローカルモデルでは弱点だった部分なので、動画制作やゲーム開発でBGM・SEが必要な人には特に試してほしいところですね。

RunPodでクラウドGPUを使いたい場合は以下の記事も参考にどうぞ。RunPodでComfyUIを使う方法では、クラウド環境での起動から生成までを解説しています。

RunPodでComfyUIを使う方法|モデル追加・ワークフロー実行・画像保存まで解説
RunPodでComfyUIを起動した後、何をすればいいか迷う人向け。最初の設定からモデル・LoRA・VAEの配置場所、ワークフローJSONの読み込み、画像生成と保存、Pod停止、よくあるエラー対処まで実際の画面で全手順を解説します。起動直後に何から手をつければいいか迷わないための実用ガイドです。
RunPodの使い方|登録からComfyUI起動まで実際にやった手順【2026年版】
RunPodは、GPUを時間単位で借りられるクラウドGPUサービスです。従量課金で月額固定はなく、のチャージから使えます。アカウント登録・クレジット購入・Pod起動・ComfyUI接続までを、実際にやった画面スクショつきで解説します。GPU選びや停止忘れ対策も初心者向けにまとめました。
AIで作った画像集・プロンプトPDF付き BOOTHで販売中

⚠️ AI画像生成をご利用の際の重要な注意事項

著作権・知的財産権について

  • 既存のキャラクター、作品、ブランドロゴなどの模倣・複製は著作権侵害にあたる可能性があります
  • 商用利用時は特に注意が必要です

肖像権について

  • 実在人物(著名人・一般人問わず)の顔や特徴を模倣した画像生成はお控えください
  • 無断での肖像権使用は法的トラブルの原因となります

利用規約の確認

  • 各AI画像生成サービスの利用規約を必ずご確認ください
  • 商用利用の可否、生成画像の権利関係は各サービスで異なります

免責事項

  • 当ブログの情報を参考にしたAI画像生成により生じた問題について、当ブログは一切の責任を負いません
  • 法的問題が生じた場合は、利用者の自己責任となります
  • 最新の法律・規約情報は公式情報をご確認ください

適切なAI画像生成を心がけ、創作活動を楽しみましょう。
詳細についてはAIと著作権についてをご覧ください。

コメント