💰較早收集於 8m

Thinking Machines 打造邊聽邊說的 AI

Thinking Machines 打造邊聽邊說的 AI
PostLinkedIn
💰閱讀原文: TechCrunch AI

💡新 AI 範式:邊聽邊說如電話對話(革新聊天機器人)(68字元)

⚡ 30-Second TL;DR

有什麼變化

現有 AI 採用輪流模式:使用者說話,AI 聽後回應。

為什麼重要

這可能實現更像人類的語音互動,提升虛擬助理與客服應用。解決目前對話式 AI 的延遲問題。

下一步行動

使用 OpenAI Realtime API 等串流 API 原型化即時 AI 對話。

誰應關注:Researchers & Academics

關鍵要點

  • 現有 AI 採用輪流模式:使用者說話,AI 聽後回應。
  • 新模型同時處理輸入並產生輸出。
  • 旨在模擬電話對話,而非順序文字交換。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Thinking Machines 採用了端到端(End-to-End)的多模態架構,直接從音訊波形進行處理,繞過了傳統的語音轉文字(ASR)與文字轉語音(TTS)的中間步驟,從而大幅降低了延遲。
  • 該模型整合了情感分析與韻律預測功能,使其能夠在對話中識別使用者的語氣變化,並即時調整 AI 的回應語調,實現更具同理心的互動。
  • 為了實現即時中斷(Barge-in)功能,該系統引入了專門的注意力機制,允許模型在生成回應的同時,持續監控並處理新的輸入音訊,從而實現無縫的對話打斷與接續。
📊 競品分析▸ Show
特色Thinking MachinesOpenAI (GPT-4o)Google (Gemini Live)
核心架構原生端到端音訊原生多模態多模態整合
延遲表現極低 (毫秒級)
中斷能力原生支援支援支援
定價模式企業 API 訂閱API 按量計費訂閱制/API

🛠️ 技術深入

  • 架構設計:採用基於 Transformer 的原生音訊編碼器,直接處理原始音訊流,而非將音訊轉化為 Token。
  • 延遲優化:利用預測性解碼(Speculative Decoding)技術,在使用者說話的同時預測可能的語句結構,縮短回應生成時間。
  • 多模態同步:透過跨模態對齊層(Cross-modal Alignment Layer),確保音訊輸入與生成的語音輸出在時間軸上保持嚴格同步。
  • 硬體加速:針對特定 GPU 架構進行算子融合(Operator Fusion),以減少記憶體存取瓶頸,提升即時推理速度。

🔮 前景展望AI analysis grounded in cited sources

語音 AI 將取代傳統的文字介面成為客戶服務的主流。
即時、自然的語音互動能顯著降低使用者的認知負荷,並提升解決複雜問題的效率。
端到端音訊模型將迫使現有的 ASR/TTS 產業鏈進行整合。
原生多模態模型消除了中間轉換步驟,使得依賴單一模態轉換的傳統技術方案在效能上失去競爭力。

時間線

2024-09
Thinking Machines 成立並獲得種子輪融資,專注於即時語音處理技術。
2025-05
發布首個原型模型,展示了初步的低延遲語音對話能力。
2026-02
完成 A 輪融資,並開始與特定企業合作進行端到端語音模型的封閉測試。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechCrunch AI