
FireRed 統一音訊理解、TTS 與語音編輯
FireRedTeam 推出 FireRedAudio,一款採用共享 9B 參數骨幹、並以獨立路徑處理理解與語音生成的通用音訊語言模型。本次發布也包含 FireRedTTS3,支援多語言零樣本聲音複製、自然語言聲音設計,以及語意與聲學語音編輯。
Tag: #voice-cloning35 results

FireRedTeam 推出 FireRedAudio,一款採用共享 9B 參數骨幹、並以獨立路徑處理理解與語音生成的通用音訊語言模型。本次發布也包含 FireRedTTS3,支援多語言零樣本聲音複製、自然語言聲音設計,以及語意與聲學語音編輯。

Vercel AI Gateway 現已提供四款 Fish Audio 語音與轉錄模型,並開放免費使用至 9 月 18 日。開發者可透過 AI SDK 7 生成語音與轉錄音訊,也能使用瀏覽器中的模型 Playground。

AI 劇日益被指控未經授權複製配音演員、遊戲角色、藝人及普通使用者的聲音與形象。權利人面臨訓練資料不透明、產業鏈責任分散、證據難以取得,以及賠償往往無法覆蓋維權成本等問題。

Kyutai 發布了 Pocket TTS,這是一個 1 億參數的模型,僅需 5 秒音訊即可在 CPU 上進行零樣本語音複製。它允許使用者自訂語音而無需微調,在靈活性上超越了競爭對手。
日本法務省發布解釋指針,明確指出聲優等人的聲音遭生成式 AI 未經授權使用時,也可能受到法律保護。指針列出涉及肖像、姓名與聲音的潛在侵權案例,並提醒 AI 服務提供者與使用者注意相關責任。
日本法務省表示,聲音可依現有權利受到法律保護。未經本人同意,使用 AI 模仿特定人物聲音製作翻唱音源,也可能構成權利侵害。

主線 llama.cpp 現已透過 llama-tts 二進位檔支援本機 Qwen3-TTS-12Hz-1.7B-Base 語音複製。它接受 WAV 或 MP3 說話者參考音訊並支援 10 種語言,但伺服器整合與更多模型支援仍未完成。
OpenAI 低調收購了專注於 AI 聲音複製工具的新創公司 Weights.gg。該交易包括收購其團隊與所有知識產權,該公司已於今年三月關閉服務。

xAI 推出 Grok 4.3,API 價格減半,並發布快速語音克隆套件。具備永久推理與 1M 權杖脈絡,但基準落後頂尖模型。可透過 xAI API 及 OpenRouter 使用。
VoxCPM2 是全新 TTS 模型,具備三種模式:Voice Design 創作新聲音、Controllable Cloning 帶風格引導的克隆,以及 Ultimate Cloning 精準再現聲音細節。它在 Seed-TTS-eval 和 CV3-eval 等基準測試中達到最先進水準。Hugging Face 有示範;GitHub 有完整細節。