📋較早收集於 6m

Hume AI 發布首個開源 TTS 模型 TADA

Hume AI 發布首個開源 TTS 模型 TADA
PostLinkedIn
📋閱讀原文: TestingCatalog
#tts#open-source#real-time-speechhume-ai-tadahume-aitada

💡開源 TTS 5 倍速即時語音應用—AI 建構者理想選擇。(38 字元)

⚡ 30-Second TL;DR

有什麼變化

Hume AI 首個開源 TTS 模型

為什麼重要

此開源發布降低開發者建構語音 AI 應用程式的門檻,促進即時 TTS 應用的創新。它挑戰專有 TTS 主導地位,提供高效能替代方案。

下一步行動

從 Hume AI 的 GitHub 儲存庫複製 TADA,並在您的硬體上測試即時 TTS 推論。

誰應關注:Developers & AI Engineers

關鍵要點

  • Hume AI 首個開源 TTS 模型
  • 文字-聲學雙重對齊標記化
  • 5 倍速即時語音生成
  • 支援 700 秒音頻

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • TADA 採用 1B 參數模型 (TADA-1B),透過 flow-matching head 生成聲學特徵,並支援不同採樣步驟調整推論延遲與 TTS 效能。[1][4]
  • 模型設計確保文字與音頻一對一映射,消除內容幻覺,並以 2–3 幀/秒運作,遠低於其他 LLM-TTS 的 12.5–75 令牌/秒。[1]
  • TADA 適合邊緣設備部署,提供低延遲隱私保護,且在相同 2048 令牌上下文下支援約 700 秒長音頻,適用長篇敘述與對話。[1]
📊 競品分析▸ Show
模型/供應商主要特點基準表現定價
Hume AI TADA開源、5x 即時速度 (RTF 0.09)、無幻覺、邊緣部署未列 Artificial Analysis;強調速度與可靠性開源免費
Inworld TTS-1 Max即時串流、語音對語音Artificial Analysis #1 (ELO 1,162);HuggingFace #2 (ELO 1,578)$15/百萬字元
Hume Octave情緒感知、11+語言HuggingFace #6 (ELO 1,558);Artificial Analysis #22從 $29/月起
Google Cloud TTS穩定、100+語言準確但情緒表達較弱按使用付費

🛠️ 技術深入

  • 採用 Text-Acoustic Dual Alignment 標記化架構:輸入音頻經編碼器與對齊器提取每個文字令牌對應的聲學特徵;輸出使用 LLM 最終隱藏狀態作為條件向量,經 flow-matching head 生成聲學特徵後解碼成音頻,並回饋模型。[1]
  • 嚴格一對一文字-音頻映射:每個 LLM 步驟對應單一文字令牌與單一音頻幀,運作於 2–3 幀/秒,實現 RTF 0.09(5x 快於同級 LLM-TTS)。[1]
  • TADA-1B 模型支援可變 flow matching 採樣步驟,影響推論延遲與 TTS 品質(如 arXiv 論文 Table 5 分析)。[1][4]

🔮 前景展望AI analysis grounded in cited sources

TADA 將加速邊緣 TTS 應用普及
其輕量足跡與低延遲設計適合手機與邊緣設備,無需雲端依賴,提升隱私與即時互動。[1]
開源將降低長篇語音生成門檻
700 秒上下文效率使長敘述與多輪對話更可行,開發者可基於代碼與預訓練模型快速迭代。[1]
情緒 TTS 將整合更多開源創新
Hume 情感 AI 背景結合 TADA 無幻覺特性,可能推動可靠情緒語音生成標準化。[1][2]

時間線

2022-10
Hume AI 成立,專注情感智能與語音合成研究
2023-12
推出第一代 TTS 與語音表情測量產品
2024-06
發布 Octave TTS 引擎,支援 LLM 情緒感知與多語言
2025-12
推出 EVI 3 語音對語音基礎模型,提升即時對話
2026-03
開源 TADA TTS 模型,實現 5x 即時速度與雙重對齊
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。