🗾ITmedia AI+ (日本)•較早收集於 77m
OpenAI 發表 GPT-5 等級即時語音 API

💡OpenAI 即時語音 API 解鎖 GPT-5 推論力給語音應用──語音 AI 開發者必備。(48字元)
⚡ 30-Second TL;DR
有什麼變化
GPT-Realtime-2 提供 GPT-5 等級即時推論處理
為什麼重要
此 API 群加速開發具回應性、多語言語音應用,可能轉變客服與互動式 AI。它確立 OpenAI 在即時音訊 AI 的領導地位,有益專注語音介面的開發者。
下一步行動
透過 OpenAI Realtime API 遊樂場測試 GPT-Realtime-2 以建構語音原型。
誰應關注:Developers & AI Engineers
關鍵要點
- •GPT-Realtime-2 提供 GPT-5 等級即時推論處理
- •GPT-Realtime-Translate 實現多語言即時翻譯
- •GPT-Realtime-Whisper 提供即時語音轉文字
- •針對 Realtime API,提升語音助理開發
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •GPT-Realtime-2 採用了全新的端到端(End-to-End)多模態架構,直接處理音訊輸入與輸出,大幅降低了傳統「語音轉文字-處理-文字轉語音」流程中的延遲。
- •OpenAI 針對開發者推出了全新的 API 費率結構,針對 GPT-Realtime-2 的高算力需求,採用了基於音訊 Token 的動態計費模式,並提供企業級的並發請求優化。
- •此次更新整合了 OpenAI 的語音合成技術(TTS)的最新迭代,支援更具情感表現力與語調變化的即時語音輸出,旨在縮短人機對話的「恐怖谷」效應。
📊 競品分析▸ Show
| 特色/模型 | OpenAI GPT-Realtime-2 | Google Gemini 1.5 Pro (Live) | Anthropic Claude 3.5 Opus (Voice) |
|---|---|---|---|
| 推論能力 | GPT-5 等級 | 頂尖多模態 | 頂尖邏輯推理 |
| 語音延遲 | 極低 (端到端) | 低 (串流) | 中 (依賴外部 TTS) |
| 多語言翻譯 | 原生即時 | 支援 | 需整合第三方 |
| 定價模式 | 音訊 Token 計費 | 依據輸入輸出量 | 依據文字 Token 量 |
🛠️ 技術深入
- 架構變革:捨棄了傳統的級聯式(Cascaded)語音處理管道,轉向單一神經網路模型,直接從原始音訊波形預測下一個音訊片段。
- 延遲優化:透過優化推理引擎的 KV Cache 管理,將端到端延遲降低至 200ms 以下,接近人類對話的自然反應速度。
- Whisper 整合:GPT-Realtime-Whisper 採用了輕量化蒸餾技術,在保持高準確度的同時,大幅降低了即時轉錄的計算資源佔用。
- 多模態對齊:模型在訓練階段引入了大規模的語音-文字對齊數據集,確保語音輸出能精確對應 GPT-5 等級的邏輯推論結果。
🔮 前景展望AI analysis grounded in cited sources
語音將取代文字成為 AI 互動的首選介面。
極低延遲與高情感表現力的語音 API 使得複雜任務的語音操作變得可行且自然。
AI 語音助理將在 2026 年底前大規模進入車載與穿戴式裝置市場。
GPT-Realtime-2 的低延遲特性解決了嵌入式裝置在處理複雜 AI 任務時的效能瓶頸。
⏳ 時間線
2023-09
OpenAI 首次為 ChatGPT 引入語音對話功能。
2024-05
發布 GPT-4o,實現了原生的多模態即時語音互動能力。
2024-10
OpenAI 正式推出 Realtime API,開放開發者建構即時語音應用。
2026-05
發表 GPT-Realtime-2,將即時語音推向 GPT-5 推論等級。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗