
Kyutai 發布 Pocket TTS,實現 CPU 語音複製
Kyutai 發布了 Pocket TTS,這是一個 1 億參數的模型,僅需 5 秒音訊即可在 CPU 上進行零樣本語音複製。它允許使用者自訂語音而無需微調,在靈活性上超越了競爭對手。
Tag: #tts36 results

Kyutai 發布了 Pocket TTS,這是一個 1 億參數的模型,僅需 5 秒音訊即可在 CPU 上進行零樣本語音複製。它允許使用者自訂語音而無需微調,在靈活性上超越了競爭對手。

一個基於 ggml 的原生 C++ 推論框架,將 12 款音訊模型整合至單一執行環境。該框架在 CUDA 上顯著優於 Python 推論,最高可達 5 倍速度提升。
網易有道宣佈 Ziyue 大模型升級至 4.0 版本,正式邁入全模態時代。官方同步宣佈將核心的多模態模型與 TTS 模型進行開源。
精選清單排名開源模型於音頻生成(TTS、克隆、音樂)、圖像生成及圖像轉影片類別。亮點包括 Qwen3-TTS 用於 TTS、FLUX.1 用於圖像,以及 LTX-2.3 支援 4K 影片與音頻。提供 Hugging Face 連結快速存取。
OpenClaw 2026.4.15 將預設 Anthropic 模型更新至 Claude Opus 4.7 並支援圖像理解,並在 Google 插件中新增 Gemini TTS 支援。新 UI 功能包含模型認證狀態卡片,記憶體改進則為 LanceDB 帶來雲端儲存及 GitHub Copilot 嵌入。修復提升工具安全性與代理可靠性。

DeepMind 推出 Gemini 3.1 Flash TTS,為下一代具表現力的 AI 語音合成。該模型引入細粒度音頻標籤,提供對 AI 生成音頻的精確控制。這實現高度可自訂且自然的語音輸出。
使用 LoRA 適配器微調 Chatterbox-Multilingual TTS,支持 8 種印度語言,仅訓練 1.4% 參數,無需音素工程。擴展 tokenizer 並使用 Brahmic 暖啟動改善初始化。模型與音頻樣本上 Hugging Face。

Deepgram 的生產級語音轉文字 (STT) 和文字轉語音 (TTS) 模型現已原生可用於 Together AI。此整合可透過 Dedicated Model Inference 存取,用於建置即時語音代理。

Mistral 的 Voxtral TTS 模型在 Apple M4 上實現「Day 0」整合,延遲僅 90ms,捕捉情緒細微差別,無雲端冷啟動問題。用於藝術機器人保留個性。提供本地 API 實作的 GitHub 儲存庫。