來源較早收集於 8m

Thinking Machines 打造邊聽邊說的 AI

閱讀原文: TechCrunch AI
#conversational-ai#real-time-processing#multimodal

新 AI 範式:邊聽邊說如電話對話(革新聊天機器人)(68字元)

30 秒速覽

有什麼變化

現有 AI 採用輪流模式:使用者說話,AI 聽後回應。

為什麼重要

這可能實現更像人類的語音互動,提升虛擬助理與客服應用。解決目前對話式 AI 的延遲問題。

下一步行動

使用 OpenAI Realtime API 等串流 API 原型化即時 AI 對話。

誰應關注:Researchers & Academics

關鍵要點

  • 現有 AI 採用輪流模式:使用者說話,AI 聽後回應。
  • 新模型同時處理輸入並產生輸出。
  • 旨在模擬電話對話,而非順序文字交換。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • Thinking Machines 採用了端到端(End-to-End)的多模態架構,直接從音訊波形進行處理,繞過了傳統的語音轉文字(ASR)與文字轉語音(TTS)的中間步驟,從而大幅降低了延遲。
  • 該模型整合了情感分析與韻律預測功能,使其能夠在對話中識別使用者的語氣變化,並即時調整 AI 的回應語調,實現更具同理心的互動。
  • 為了實現即時中斷(Barge-in)功能,該系統引入了專門的注意力機制,允許模型在生成回應的同時,持續監控並處理新的輸入音訊,從而實現無縫的對話打斷與接續。

競品分析

核心架構
Thinking Machines
原生端到端音訊
OpenAI (GPT-4o)
原生多模態
Google (Gemini Live)
多模態整合
延遲表現
Thinking Machines
極低 (毫秒級)
OpenAI (GPT-4o)
Google (Gemini Live)
中斷能力
Thinking Machines
原生支援
OpenAI (GPT-4o)
支援
Google (Gemini Live)
支援
定價模式
Thinking Machines
企業 API 訂閱
OpenAI (GPT-4o)
API 按量計費
Google (Gemini Live)
訂閱制/API

技術深入

  • 架構設計:採用基於 Transformer 的原生音訊編碼器,直接處理原始音訊流,而非將音訊轉化為 Token。
  • 延遲優化:利用預測性解碼(Speculative Decoding)技術,在使用者說話的同時預測可能的語句結構,縮短回應生成時間。
  • 多模態同步:透過跨模態對齊層(Cross-modal Alignment Layer),確保音訊輸入與生成的語音輸出在時間軸上保持嚴格同步。
  • 硬體加速:針對特定 GPU 架構進行算子融合(Operator Fusion),以減少記憶體存取瓶頸,提升即時推理速度。

前景展望基於引用來源的 AI 分析

語音 AI 將取代傳統的文字介面成為客戶服務的主流。
即時、自然的語音互動能顯著降低使用者的認知負荷,並提升解決複雜問題的效率。
端到端音訊模型將迫使現有的 ASR/TTS 產業鏈進行整合。
原生多模態模型消除了中間轉換步驟,使得依賴單一模態轉換的傳統技術方案在效能上失去競爭力。

時間線

2024-09
Thinking Machines 成立並獲得種子輪融資,專注於即時語音處理技術。
2025-05
發布首個原型模型,展示了初步的低延遲語音對話能力。
2026-02
完成 A 輪融資,並開始與特定企業合作進行端到端語音模型的封閉測試。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechCrunch AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。