最新收集於 2h

OpenAI 重構語音 AI,實現近乎即時互動

OpenAI 重構語音 AI,實現近乎即時互動
PostLinkedIn
閱讀原文: 雷峰网

💡了解 WARP、Go 與具狀態感知的打斷處理,如何讓語音 Agent 維持連續回應。

⚡ 30-Second TL;DR

有什麼變化

GPT-Live 採用快速通道、深度推理通道與非同步任務通道,支援連續語音互動。

為什麼重要

這套架構顯示,可靠的語音 Agent 需要具備時間限制感知的媒體管線,而不是單一的語音轉文字、LLM 推理再轉語音流程。開發語音 Agent 的團隊可能需要將 p95 尾端延遲、打斷正確性與狀態連續性列為核心產品指標。

下一步行動

為語音 Agent 原型分離媒體、推理與工具任務通道,並測量音訊影格 p95 延遲與打斷恢復能力,而不只觀察平均回應時間。

誰應關注:Developers & AI Engineers

關鍵要點

  • GPT-Live 採用快速通道、深度推理通道與非同步任務通道,支援連續語音互動。
  • 部分媒體與推理堆疊由 Python asyncio 改寫為 Go,並加入 UDP 與 Linux 核心層最佳化。
  • OpenAI 的 WARP 協定將 WebRTC 通道建立流程由六次網路往返縮短至一次。
  • 模型持續管理輪流發言、打斷、播放狀態、執行個體遷移與上下文壓縮。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • OpenAI 在此架構中引入了自適應抖動緩衝(Adaptive Jitter Buffer)技術,能根據網路狀況動態調整音訊封包的等待時間,進一步減少語音斷續感。
  • 系統整合了端到端的語音編解碼器最佳化,支援 Opus 編碼的硬體加速,顯著降低了 CPU 在處理高併發語音串流時的負載。
  • GPT-Live 的架構設計中包含了針對『打斷(Barge-in)』行為的專用預測模型,能以毫秒級速度偵測使用者語音意圖並立即停止模型輸出。
  • 為了應對全球化部署,OpenAI 在邊緣節點(Edge Nodes)部署了輕量級推理引擎,將部分上下文壓縮任務從中心伺服器下放至邊緣,減少傳輸延遲。
  • 該系統引入了基於優先級的排程演算法,確保語音處理執行緒在作業系統層級擁有最高搶佔權,避免被其他非同步任務阻塞。
📊 競品分析▸ Show
特性OpenAI GPT-LiveGoogle Gemini LiveAnthropic Claude (Voice)
核心架構專用 Go 媒體堆疊 + WARPWebRTC + TPU 最佳化整合式 API 呼叫
延遲表現極低 (p95 最佳化)低 (依賴 Google 骨幹網)中等 (基於標準 API)
打斷機制專用預測模型內建語音偵測依賴後端處理
部署策略邊緣計算 + 中心化全球雲端基礎設施雲端 API 優先

🛠️ 技術深入

  • 媒體堆疊遷移:將 Python asyncio 替換為 Go 語言,利用其高效的 Goroutine 模型處理高併發 I/O,減少上下文切換開銷。
  • 網路協定:WARP 協定透過合併握手階段,將 WebRTC 的 ICE/DTLS 建立流程從 6 次往返(RTT)壓縮至 1 次。
  • 核心最佳化:在 Linux 核心層面調整了 TCP/UDP 緩衝區大小,並啟用 eBPF 進行封包過濾與路由加速。
  • 任務分離:將推理(Inference)、工具呼叫(Tool Use)與媒體串流(Media Streaming)拆分為獨立的微服務,透過共享記憶體(Shared Memory)進行低延遲通訊。

🔮 前景展望AI analysis grounded in cited sources

語音 AI 將成為企業級客戶服務的標準配置
隨著 p95 延遲降至人類對話可接受範圍,語音 AI 的互動品質已達到可大規模取代真人客服的門檻。
Go 語言將成為高併發 AI 媒體處理的產業標準
OpenAI 成功將 Python 遷移至 Go 以解決延遲問題,將促使其他 AI 廠商跟進重構其底層媒體堆疊。

時間線

2023-09
OpenAI 首次發布支援語音對話的 GPT-4 模型
2024-05
發布 GPT-4o,實現多模態即時語音互動能力
2025-02
OpenAI 開始針對語音延遲進行大規模架構重構
2026-05
GPT-Live 系統正式上線,全面導入 WARP 協定與 Go 語言堆疊
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网