
Noiz AI 開源音頻生成大模型,4步出聲
Noiz AI 聯合香港科技大學與清華大學,開源了一款音頻生成大模型,實現了4步出聲,單卡推理延遲僅0.24秒。
Tag: #audio-generation5 results

Noiz AI 聯合香港科技大學與清華大學,開源了一款音頻生成大模型,實現了4步出聲,單卡推理延遲僅0.24秒。
精選清單排名開源模型於音頻生成(TTS、克隆、音樂)、圖像生成及圖像轉影片類別。亮點包括 Qwen3-TTS 用於 TTS、FLUX.1 用於圖像,以及 LTX-2.3 支援 4K 影片與音頻。提供 Hugging Face 連結快速存取。

Sand.ai 開源其 15B 參數音視頻生成模型。同時釋出分散注意力模組與統一編譯框架。三天內皆上傳 GitHub。

Spotify 現在允許如 OpenClaw 等 AI 代理生成個人化播客。此整合為自訂音頻內容開啟新可能。此功能針對科技愛好者和 AI 開發者。

Google Vids 獲得 AI 升級,整合 Veo 影片生成與 Lyria 音頻創作功能。新功能包括可導向 AI 化身,用於自訂簡報。此更新將 Google 最強大的 AI 工具整合至單一影片製作平台。