⚡雷峰网•最新收集於 2h
OpenAI 重構語音 AI,實現近乎即時互動

💡了解 WARP、Go 與具狀態感知的打斷處理,如何讓語音 Agent 維持連續回應。
⚡ 30-Second TL;DR
有什麼變化
GPT-Live 採用快速通道、深度推理通道與非同步任務通道,支援連續語音互動。
為什麼重要
這套架構顯示,可靠的語音 Agent 需要具備時間限制感知的媒體管線,而不是單一的語音轉文字、LLM 推理再轉語音流程。開發語音 Agent 的團隊可能需要將 p95 尾端延遲、打斷正確性與狀態連續性列為核心產品指標。
下一步行動
為語音 Agent 原型分離媒體、推理與工具任務通道,並測量音訊影格 p95 延遲與打斷恢復能力,而不只觀察平均回應時間。
誰應關注:Developers & AI Engineers
關鍵要點
- •GPT-Live 採用快速通道、深度推理通道與非同步任務通道,支援連續語音互動。
- •部分媒體與推理堆疊由 Python asyncio 改寫為 Go,並加入 UDP 與 Linux 核心層最佳化。
- •OpenAI 的 WARP 協定將 WebRTC 通道建立流程由六次網路往返縮短至一次。
- •模型持續管理輪流發言、打斷、播放狀態、執行個體遷移與上下文壓縮。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •OpenAI 在此架構中引入了自適應抖動緩衝(Adaptive Jitter Buffer)技術,能根據網路狀況動態調整音訊封包的等待時間,進一步減少語音斷續感。
- •系統整合了端到端的語音編解碼器最佳化,支援 Opus 編碼的硬體加速,顯著降低了 CPU 在處理高併發語音串流時的負載。
- •GPT-Live 的架構設計中包含了針對『打斷(Barge-in)』行為的專用預測模型,能以毫秒級速度偵測使用者語音意圖並立即停止模型輸出。
- •為了應對全球化部署,OpenAI 在邊緣節點(Edge Nodes)部署了輕量級推理引擎,將部分上下文壓縮任務從中心伺服器下放至邊緣,減少傳輸延遲。
- •該系統引入了基於優先級的排程演算法,確保語音處理執行緒在作業系統層級擁有最高搶佔權,避免被其他非同步任務阻塞。
📊 競品分析▸ Show
| 特性 | OpenAI GPT-Live | Google Gemini Live | Anthropic Claude (Voice) |
|---|---|---|---|
| 核心架構 | 專用 Go 媒體堆疊 + WARP | WebRTC + TPU 最佳化 | 整合式 API 呼叫 |
| 延遲表現 | 極低 (p95 最佳化) | 低 (依賴 Google 骨幹網) | 中等 (基於標準 API) |
| 打斷機制 | 專用預測模型 | 內建語音偵測 | 依賴後端處理 |
| 部署策略 | 邊緣計算 + 中心化 | 全球雲端基礎設施 | 雲端 API 優先 |
🛠️ 技術深入
- 媒體堆疊遷移:將 Python asyncio 替換為 Go 語言,利用其高效的 Goroutine 模型處理高併發 I/O,減少上下文切換開銷。
- 網路協定:WARP 協定透過合併握手階段,將 WebRTC 的 ICE/DTLS 建立流程從 6 次往返(RTT)壓縮至 1 次。
- 核心最佳化:在 Linux 核心層面調整了 TCP/UDP 緩衝區大小,並啟用 eBPF 進行封包過濾與路由加速。
- 任務分離:將推理(Inference)、工具呼叫(Tool Use)與媒體串流(Media Streaming)拆分為獨立的微服務,透過共享記憶體(Shared Memory)進行低延遲通訊。
🔮 前景展望AI analysis grounded in cited sources
語音 AI 將成為企業級客戶服務的標準配置
隨著 p95 延遲降至人類對話可接受範圍,語音 AI 的互動品質已達到可大規模取代真人客服的門檻。
Go 語言將成為高併發 AI 媒體處理的產業標準
OpenAI 成功將 Python 遷移至 Go 以解決延遲問題,將促使其他 AI 廠商跟進重構其底層媒體堆疊。
⏳ 時間線
2023-09
OpenAI 首次發布支援語音對話的 GPT-4 模型
2024-05
發布 GPT-4o,實現多模態即時語音互動能力
2025-02
OpenAI 開始針對語音延遲進行大規模架構重構
2026-05
GPT-Live 系統正式上線,全面導入 WARP 協定與 Go 語言堆疊
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网 ↗