📱Engadget•最新收集於 2h
ChatGPT 語音模式變得更自然

💡了解 ChatGPT 更新後的語音模式,如何讓語音 AI 互動變得更自然。
⚡ 30-Second TL;DR
有什麼變化
ChatGPT 語音模式旨在讓語音對話變得更自然、減少尷尬感。
為什麼重要
更自然的語音互動有助於提升可及性,並讓 ChatGPT 更適合免持操作、語言練習及對話式應用。AI 實務工作者也能將此功能視為設計低摩擦語音介面的參考。
下一步行動
開啟 ChatGPT 並在免持操作流程中測試語音模式,將回應自然度、打斷處理能力及任務完成度與現有語音介面比較。
誰應關注:Developers & AI Engineers
關鍵要點
- •ChatGPT 語音模式旨在讓語音對話變得更自然、減少尷尬感。
- •使用者可以透過對話式語音交流與 ChatGPT 互動。
- •文章提供啟用及使用更新後語音模式的實用說明。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •OpenAI 在語音模式中引入了多模態模型 GPT-4o,實現了音訊、視覺與文字的即時處理,大幅降低了語音互動的延遲。
- •新版語音模式具備情緒感知能力,能夠根據使用者的語氣調整回應的語調、節奏與情感表達,使對話更具擬人化特徵。
- •該功能支援中斷對話(Interruption),使用者可以在 AI 說話時隨時插話,系統會即時停止並回應,模擬真實人類的社交互動。
- •OpenAI 為語音模式設計了多種預設聲音選項,並透過嚴格的過濾機制防止 AI 模仿特定公眾人物或產生不當內容。
- •語音模式的更新不僅限於對話流暢度,還整合了視覺輸入功能,允許使用者透過鏡頭展示環境,讓 AI 進行即時語音解說。
📊 競品分析▸ Show
| 特色 | ChatGPT (Advanced Voice) | Google Gemini Live | Claude (Voice) |
|---|---|---|---|
| 核心技術 | GPT-4o (多模態) | Gemini 1.5 Pro | Claude 3.5 Sonnet |
| 語音延遲 | 極低 (約 232ms) | 低 | 中等 |
| 情緒表達 | 高度擬人化 | 自然但較為平穩 | 基礎語音轉文字 |
| 視覺整合 | 支援即時視覺分析 | 支援部分視覺分析 | 暫無即時語音視覺整合 |
🛠️ 技術深入
- 採用端到端(End-to-End)神經網路架構,直接處理音訊輸入與輸出,無需經過傳統的語音轉文字(ASR)與文字轉語音(TTS)中介步驟。
- 透過 GPT-4o 模型架構,實現了跨模態的隱含空間映射,使模型能直接理解語音中的語調、笑聲與背景雜音。
- 系統架構優化了 Token 預測速度,確保在處理複雜語音指令時能維持毫秒級的反應時間。
- 實作了專用的音訊編解碼器,以在低頻寬環境下維持高保真度的語音輸出品質。
🔮 前景展望AI analysis grounded in cited sources
語音 AI 將取代傳統客服與語言學習軟體。
隨著語音互動的自然度與情緒感知能力提升,AI 已能勝任需要高度同理心與即時反應的服務場景。
多模態語音互動將成為智慧型手機的標準作業系統介面。
語音與視覺的即時整合降低了操作門檻,將使螢幕觸控逐漸轉向以語音為主的 AI 助理驅動模式。
⏳ 時間線
2023-09
OpenAI 首次推出 ChatGPT 語音對話功能,支援基礎語音互動。
2024-05
OpenAI 發布 GPT-4o,展示了具備極低延遲與情感表達能力的新一代語音模式。
2024-09
ChatGPT 進階語音模式(Advanced Voice Mode)正式向 Plus 與 Team 用戶推送。
2025-02
OpenAI 擴展語音模式支援語言範圍,並優化了多語言語音的自然度。
2026-05
ChatGPT 語音模式整合更深度的個人化記憶功能,能根據過往對話調整語音風格。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Engadget ↗
