
Fish Audio 模型免費登陸 Vercel
Vercel AI Gateway 現已提供四款 Fish Audio 語音與轉錄模型,並開放免費使用至 9 月 18 日。開發者可透過 AI SDK 7 生成語音與轉錄音訊,也能使用瀏覽器中的模型 Playground。
Tag: #text-to-speech9 results

Vercel AI Gateway 現已提供四款 Fish Audio 語音與轉錄模型,並開放免費使用至 9 月 18 日。開發者可透過 AI SDK 7 生成語音與轉錄音訊,也能使用瀏覽器中的模型 Playground。

Mistral AI 推出 Voxtral TTS,這是專為企業設計的頂尖品質開放權重文字轉語音模型,聲稱優於 ElevenLabs。模型權重免費下載,讓企業可在自家伺服器或智慧型手機上運行,無需依賴第三方。此模型完善 Mistral 的企業自有 AI 堆疊,包括端到端語音轉語音管道。

Reddit 正測試將文字貼文與部分留言轉換成短篇影音體驗的 AI 生成影片。AI 語音會朗讀內容,影片同步標示文字,並註明對話由 AI 配音。

中國語音 AI 新創 VUI Labs 的 Luna-TTS 登上 Hugging Face TTS Arena 榜首,超越 ElevenLabs、MiniMax 與 Cartesia。在 Artificial Analysis 的 Speech Arena 中,Luna-TTS 也名列第三並領先 Google,首個音訊封包延遲達 41.6 毫秒。

Hugging Face 文章介紹 NVIDIA Magpie TTS,協助開發者建構低延遲的多語言語音代理。其開放權重與部署控制能力,適合需要自行客製化及運行文字轉語音系統的實務團隊。

NVIDIA 的 NeMo-Speech.cpp 支援在本機執行經 GGUF 量化的語音辨識、文字轉語音與編解碼元件。列出的堆疊包括 Magpie-TTS、Nemotron Speech、Nemotron ASR、Parakeet 模型及 NanoCodec。

主線 llama.cpp 現已透過 llama-tts 二進位檔支援本機 Qwen3-TTS-12Hz-1.7B-Base 語音複製。它接受 WAV 或 MP3 說話者參考音訊並支援 10 種語言,但伺服器整合與更多模型支援仍未完成。
一位後端與大數據開發者尋求進入語音生成 LLM 領域的指引。使用者表示由於資源過多,且教學內容往往從基礎回歸分析開始,導致學習方向感到困惑。
Calliope creates synchronized narrated EPUB3 e-books from text using open-source TTS like XTTS-v2. Ensures exact audio-text sync via direct timestamps, preserves original layout offline. Avoids cloud privacy and cost issues.