來源TechCrunch AI•較早收集於 8m
Thinking Machines 打造邊聽邊說的 AI

新 AI 範式:邊聽邊說如電話對話(革新聊天機器人)(68字元)
30 秒速覽
有什麼變化
現有 AI 採用輪流模式:使用者說話,AI 聽後回應。
為什麼重要
這可能實現更像人類的語音互動,提升虛擬助理與客服應用。解決目前對話式 AI 的延遲問題。
下一步行動
使用 OpenAI Realtime API 等串流 API 原型化即時 AI 對話。
誰應關注:Researchers & Academics
關鍵要點
- •現有 AI 採用輪流模式:使用者說話,AI 聽後回應。
- •新模型同時處理輸入並產生輸出。
- •旨在模擬電話對話,而非順序文字交換。
深度解析
本篇為 AI 生成分析,非原文內容。
增強重點摘要
- •Thinking Machines 採用了端到端(End-to-End)的多模態架構,直接從音訊波形進行處理,繞過了傳統的語音轉文字(ASR)與文字轉語音(TTS)的中間步驟,從而大幅降低了延遲。
- •該模型整合了情感分析與韻律預測功能,使其能夠在對話中識別使用者的語氣變化,並即時調整 AI 的回應語調,實現更具同理心的互動。
- •為了實現即時中斷(Barge-in)功能,該系統引入了專門的注意力機制,允許模型在生成回應的同時,持續監控並處理新的輸入音訊,從而實現無縫的對話打斷與接續。
競品分析
核心架構
- Thinking Machines
- 原生端到端音訊
- OpenAI (GPT-4o)
- 原生多模態
- Google (Gemini Live)
- 多模態整合
延遲表現
- Thinking Machines
- 極低 (毫秒級)
- OpenAI (GPT-4o)
- 低
- Google (Gemini Live)
- 低
中斷能力
- Thinking Machines
- 原生支援
- OpenAI (GPT-4o)
- 支援
- Google (Gemini Live)
- 支援
定價模式
- Thinking Machines
- 企業 API 訂閱
- OpenAI (GPT-4o)
- API 按量計費
- Google (Gemini Live)
- 訂閱制/API
| 特色 | Thinking Machines | OpenAI (GPT-4o) | Google (Gemini Live) |
|---|---|---|---|
| 核心架構 | 原生端到端音訊 | 原生多模態 | 多模態整合 |
| 延遲表現 | 極低 (毫秒級) | 低 | 低 |
| 中斷能力 | 原生支援 | 支援 | 支援 |
| 定價模式 | 企業 API 訂閱 | API 按量計費 | 訂閱制/API |
技術深入
- 架構設計:採用基於 Transformer 的原生音訊編碼器,直接處理原始音訊流,而非將音訊轉化為 Token。
- 延遲優化:利用預測性解碼(Speculative Decoding)技術,在使用者說話的同時預測可能的語句結構,縮短回應生成時間。
- 多模態同步:透過跨模態對齊層(Cross-modal Alignment Layer),確保音訊輸入與生成的語音輸出在時間軸上保持嚴格同步。
- 硬體加速:針對特定 GPU 架構進行算子融合(Operator Fusion),以減少記憶體存取瓶頸,提升即時推理速度。
前景展望基於引用來源的 AI 分析
語音 AI 將取代傳統的文字介面成為客戶服務的主流。
即時、自然的語音互動能顯著降低使用者的認知負荷,並提升解決複雜問題的效率。
端到端音訊模型將迫使現有的 ASR/TTS 產業鏈進行整合。
原生多模態模型消除了中間轉換步驟,使得依賴單一模態轉換的傳統技術方案在效能上失去競爭力。
時間線
2024-09
Thinking Machines 成立並獲得種子輪融資,專注於即時語音處理技術。
2025-05
發布首個原型模型,展示了初步的低延遲語音對話能力。
2026-02
完成 A 輪融資,並開始與特定企業合作進行端到端語音模型的封閉測試。
- 2024-09Thinking Machines 成立並獲得種子輪融資,專注於即時語音處理技術。
- 2025-05發布首個原型模型,展示了初步的低延遲語音對話能力。
- 2026-02完成 A 輪融資,並開始與特定企業合作進行端到端語音模型的封閉測試。
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechCrunch AI ↗
每週電子報
每週一封,可隨時退訂。