🏠IT之家•較早收集於 3h
Stability AI 發布 Stability Audio 3.0 音頻模型系列

💡全新的頂尖音頻模型,支援 6 分鐘長度生成,並強調數據合規性。
⚡ 30-Second TL;DR
有什麼變化
支援生成長達 6 分 20 秒的完整音樂曲目。
為什麼重要
此次發布顯著提升了 AI 生成音樂的連貫性與長度,使其成為專業創作者的實用工具。對授權數據集的重視,為生成式音頻的法律合規性樹立了新標竿。
下一步行動
從其儲存庫下載開源的小型或中型 Stability Audio 3.0 權重,以測試本地音頻生成的效能。
誰應關注:Developers & AI Engineers
關鍵要點
- •支援生成長達 6 分 20 秒的完整音樂曲目。
- •包含四種模型規格,小型版本針對本地設備執行進行了優化。
- •使用合法授權數據集進行訓練,確保符合音樂產業合規標準。
- •小型與中型模型開源,大型模型則透過 API 提供。
🧠 深度解析
Web-grounded analysis with 16 cited sources.
🔑 增強重點摘要
- •Stability Audio 3.0 支援 LoRA 訓練文件,允許用戶根據自己的音頻庫微調模型,並提供音頻修復(inpainting)功能,用於編輯音軌的特定片段。
- •在 Stability AI 社群許可證下,年收入低於 100 萬美元的個人和組織可以自由地將生成的音頻用於商業用途,而企業許可證則為大型組織提供商業覆蓋和法律賠償。
- •Stable Audio 3.0 採用了全新的統一架構,包含一個語義聲學自動編碼器,旨在作為 Stability AI 下一代專業授權模型的基礎,實現更長、更靈活的音頻輸出,並支援每秒精細度控制。
- •該模型系列包含四種變體:Small SFX 和 Small 模型各具 4.59 億參數,可在 H200 GPU 上於 0.44 秒內生成長達 2 分鐘的音軌;Medium 模型擁有 14 億參數,可在 1.31 秒內生成長達 6 分 20 秒的音軌;而最大的 Large 模型則有 27 億參數,僅透過 API 提供。
- •Stable Audio 3.0 模型是使用來自 AudioSparx(超過 80 萬個音頻,19,500 多小時)的合法授權音頻以及來自 Freesound 的創用 CC 錄音進行訓練的,並對音樂錄音進行了過濾,以確保不包含未經授權的受版權保護材料。
📊 競品分析▸ Show
| 特性/模型 | Stability Audio 3.0 | Suno v5.5 | Udio v1.5 | Google DeepMind Lyria 3 Pro | Eleven Music |
|---|---|---|---|---|---|
| 最大生成長度 | 6分20秒 (Medium/Large), 2分鐘 (Small) | 完整歌曲 (通常數分鐘) | 完整歌曲 (通常數分鐘) | 3-5分鐘 | 未明確說明 (高保真音樂) |
| 開源狀態 | Small/Medium 模型開源 | 閉源 | 閉源 | 閉源 (API 級別) | 閉源 |
| 商業使用 | 年收入低於 $1M 免費商用,企業版提供法律賠償 | 僅限活躍訂閱者擁有商用權利 | 需付費訂閱,曾因授權過渡暫停下載 | 平台和 API 側的結構化生成 | 未明確說明 |
| 訓練數據 | 合法授權數據 (AudioSparx, Creative Commons) | 已與主要唱片公司達成授權協議 | 已與環球音樂集團達成授權協議 | 未明確說明 | 未明確說明 |
| 特色功能 | LoRA 微調、音頻修復、裝置端生成 | 易於使用、生成人聲和歌詞 | 修訂、音軌分離、時間軸編輯、音頻修復 | 整體連貫性強、自然流暢 | 卓越的音頻質量、無縫人聲合成 |
🛠️ 技術深入
- 模型類型:Stable Audio 3 是一個快速潛在擴散模型家族,用於可變長度音頻生成和編輯。
- 核心架構:模型運行在一個新的架構上,該架構包含一個新穎的語義聲學自動編碼器。
- 自動編碼器功能:將音頻投影到緊湊的潛在空間中,實現高效的基於擴散的生成,同時保留音頻保真度並鼓勵潛在空間中的語義結構。
- 可變長度生成:引入了一種新的可變長度音頻生成方法,允許以秒為單位進行精細控制,避免了為短音頻生成時因填充靜音而造成的計算浪費。
- 音頻修復(Inpainting):支援音頻修復功能,可進行有針對性的音頻編輯和短錄音的延續。
- 訓練過程:採用對抗性後訓練(adversarial post-training)來加速推理並提高生成質量,減少推理步驟同時提高保真度和提示遵循度。
- 模型參數:Small SFX 和 Small 模型各包含 4.59 億參數;Medium 模型包含 14 億參數;Large 模型包含 27 億參數。
- 推理速度:Small/Small SFX 模型在 H200 GPU 上生成長達 2 分鐘的音軌僅需 0.44 秒;Medium 模型在 H200 GPU 上生成長達 6 分 20 秒的音軌僅需 1.31 秒。Small 模型甚至可以在 MacBook Pro M4 上運行,生成 120 秒音頻僅需 5.92 秒(使用 CoreML 加速後為 3 秒)。
- 訓練數據集:模型使用來自 AudioSparx(806,284 個音頻,超過 19,500 小時)的合法授權音頻和來自 Freesound 的創用 CC 錄音進行訓練,並對音樂錄音進行了過濾以確保合規性。
- 微調支援:提供 LoRA 訓練文件,允許用戶根據自己的音頻庫進行模型微調。
🔮 前景展望AI analysis grounded in cited sources
AI 音樂生成市場將加速成長,並更加重視合法授權數據。
Stability AI 強調其模型使用合法授權數據集訓練,並為企業客戶提供法律賠償,這將促使更多公司遵循合規標準,並可能加速市場對「商業安全」AI 音樂工具的採用。
裝置端(on-device)AI 音樂創作將變得更加普及,降低對雲端服務的依賴。
Stability Audio 3.0 的小型模型專為本地設備(如智慧型手機和消費級筆記型電腦)優化,能夠在離線狀態下進行完整的音樂創作,這將擴大 AI 音樂工具的用戶基礎和使用場景。
AI 音樂生成工具將更深入整合到專業音樂製作流程中,提供更精細的控制和編輯能力。
Stable Audio 3.0 支援 LoRA 微調、音頻修復(inpainting)以及可變長度生成,這些功能為專業創作者提供了更靈活的創作和編輯選項,有助於 AI 工具融入現有的數位音頻工作站(DAW)流程。
⏳ 時間線
2019
Stability AI 成立
2022-08
Stability AI 發布 Stable Diffusion,在圖像生成領域嶄露頭角
2023-09
Stability AI 首次推出 Stable Audio,能夠生成長達 95 秒的音頻,並與 AudioSparx 合作提供訓練數據
2024-04
Stable Audio 2.0 發布,支援生成長達 3 分鐘的音頻
2025-09
Stable Audio 2.5 發布,專注於專業音頻製作,支援多部分作曲,並引入了將生成步驟從 50 步減少到 8 步的技術突破
2026-05-20
Stability Audio 3.0 發布,支援生成長達 6 分 20 秒的音樂,並引入新的統一架構和裝置端生成能力
📎 來源 (16)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗
