
Amazon Polly 雙向串流即時語音合成
Amazon Polly 推出雙向串流 API,用於對話式 AI 的即時 TTS。可同時傳送文字並接收音訊,適合 LLM 增量回應。此功能實現完整文字就緒前低延遲語音合成。
Tag: #tts36 results

Amazon Polly 推出雙向串流 API,用於對話式 AI 的即時 TTS。可同時傳送文字並接收音訊,適合 LLM 增量回應。此功能實現完整文字就緒前低延遲語音合成。

Mistral 發布全新開源語音生成模型。此輕量模型可在智慧手錶和智慧型手機等資源受限裝置上高效運行。

KoboldCpp 以 1.110 版慶祝三週年,新增原生高品質 Qwen3 TTS(0.6/1.7B)支援語音克隆,以及 Ace Step 1.5 音樂生成。示範影片展示這些功能,包括一首史詩音樂作品。可於 GitHub 下載。
科大訊飛公佈了一項關於人機交互系統中口音與風格控制的新專利。該技術實現了動態狀態繼承與場景感知語音合成。
一份針對小型 TTS 模型進行的全面 CPU 基準測試,採用 UTMOS MOS 評分。分析重點介紹了 Kyutai 的 Pocket TTS 獨特的串流架構,以及不同推論後端之間的效能權衡。

NagaTranslate 是一項旨在為印度 Nagaland 的低資源語言(如 Nagamese、Ao 和 Sema)開發翻譯與語音處理管線的計畫。該專案目前採用商業 LLM API、針對 TTS 微調的 VITS 模型以及用於 ASR 的 Whisper 模型。

Inflect-Nano 是一款僅有 4.63M 參數的高效語音合成模型,專為在低階硬體上進行本地執行而設計。它具備獨特的尺寸與功能比,非常適合嵌入式裝置及離線語音代理。

Resemble AI 發布了 DramaBox,這是一款基於 LTX 2.3 架構的新型語音模型,旨在提供目前開源生態系統中最具表現力的語音合成效果。
.png)
Together AI 推出 Voice Finder,這是款新工具,讓開發者能在 TTS 模型中搜尋、匹配、篩選並試聽超過 600 種語音。它支援自然語言提示或上傳音頻樣本進行精準語音選擇。這能簡化將合適語音整合至應用程式的流程。
OpenClaw 2026.4.25-beta.4 提供全面 TTS 升級,包括 Azure Speech 和 ElevenLabs v3 等新提供者、聊天範圍控制及每代理覆寫。外掛管理轉移至持久註冊表,提升更新與發現效率。OpenTelemetry、瀏覽器自動化、UI 功能及安裝強化擴展,提升可靠性。