💰TechCrunch AI•較早收集於 8m
Thinking Machines 打造邊聽邊說的 AI

💡新 AI 範式:邊聽邊說如電話對話(革新聊天機器人)(68字元)
⚡ 30-Second TL;DR
有什麼變化
現有 AI 採用輪流模式:使用者說話,AI 聽後回應。
為什麼重要
這可能實現更像人類的語音互動,提升虛擬助理與客服應用。解決目前對話式 AI 的延遲問題。
下一步行動
使用 OpenAI Realtime API 等串流 API 原型化即時 AI 對話。
誰應關注:Researchers & Academics
關鍵要點
- •現有 AI 採用輪流模式:使用者說話,AI 聽後回應。
- •新模型同時處理輸入並產生輸出。
- •旨在模擬電話對話,而非順序文字交換。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Thinking Machines 採用了端到端(End-to-End)的多模態架構,直接從音訊波形進行處理,繞過了傳統的語音轉文字(ASR)與文字轉語音(TTS)的中間步驟,從而大幅降低了延遲。
- •該模型整合了情感分析與韻律預測功能,使其能夠在對話中識別使用者的語氣變化,並即時調整 AI 的回應語調,實現更具同理心的互動。
- •為了實現即時中斷(Barge-in)功能,該系統引入了專門的注意力機制,允許模型在生成回應的同時,持續監控並處理新的輸入音訊,從而實現無縫的對話打斷與接續。
📊 競品分析▸ Show
| 特色 | Thinking Machines | OpenAI (GPT-4o) | Google (Gemini Live) |
|---|---|---|---|
| 核心架構 | 原生端到端音訊 | 原生多模態 | 多模態整合 |
| 延遲表現 | 極低 (毫秒級) | 低 | 低 |
| 中斷能力 | 原生支援 | 支援 | 支援 |
| 定價模式 | 企業 API 訂閱 | API 按量計費 | 訂閱制/API |
🛠️ 技術深入
- 架構設計:採用基於 Transformer 的原生音訊編碼器,直接處理原始音訊流,而非將音訊轉化為 Token。
- 延遲優化:利用預測性解碼(Speculative Decoding)技術,在使用者說話的同時預測可能的語句結構,縮短回應生成時間。
- 多模態同步:透過跨模態對齊層(Cross-modal Alignment Layer),確保音訊輸入與生成的語音輸出在時間軸上保持嚴格同步。
- 硬體加速:針對特定 GPU 架構進行算子融合(Operator Fusion),以減少記憶體存取瓶頸,提升即時推理速度。
🔮 前景展望AI analysis grounded in cited sources
語音 AI 將取代傳統的文字介面成為客戶服務的主流。
即時、自然的語音互動能顯著降低使用者的認知負荷,並提升解決複雜問題的效率。
端到端音訊模型將迫使現有的 ASR/TTS 產業鏈進行整合。
原生多模態模型消除了中間轉換步驟,使得依賴單一模態轉換的傳統技術方案在效能上失去競爭力。
⏳ 時間線
2024-09
Thinking Machines 成立並獲得種子輪融資,專注於即時語音處理技術。
2025-05
發布首個原型模型,展示了初步的低延遲語音對話能力。
2026-02
完成 A 輪融資,並開始與特定企業合作進行端到端語音模型的封閉測試。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechCrunch AI ↗