來源极客公园•較早收集於 9h
Microsoft 或打造全雙工語音模型

#real-time-voice#full-duplex#multilingual-ai#azuremicrosoft-mai-realtimemicrosoftmai realtimemicrosoft foundrycopilotopenai
Microsoft 或正準備原生語音模型,挑戰 OpenAI 的即時音訊技術並改變 Azure 的 AI 依賴。
30 秒速覽
有什麼變化
據報 MAI Realtime 提供全雙工語音互動系統,可同時聆聽與說話。
為什麼重要
若消息屬實,MAI Realtime 將強化 Microsoft 對即時語音基礎設施的掌控,並為開發者提供 OpenAI 即時語音技術之外的選擇。這也可能代表 Microsoft 正更積極地為 Azure 與 Copilot 等戰略工作負載打造自研模型。
下一步行動
留意 MAI Playground 與 Microsoft Foundry 是否正式推出 MAI Realtime 預覽版,並將其延遲、打斷處理與多語言表現與目前使用的語音 API 進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •據報 MAI Realtime 提供全雙工語音互動系統,可同時聆聽與說話。
- •據稱該模型支援包括中文、英文、日文與韓文在內的 17 種語言,並能無縫切換。
- •它據報具備低延遲、自然的打斷處理能力,並提供 Victoria 與 Grant 兩種語音。
- •Microsoft 可能利用該模型降低 Azure 服務對 OpenAI 元件的依賴,並透過 Microsoft Foundry 與 Copilot 部署。
深度解析
本篇為 AI 生成分析,非原文內容。
增強重點摘要
- •MAI Realtime 採用端到端(End-to-End)語音處理架構,繞過了傳統語音轉文字(ASR)與文字轉語音(TTS)的串聯延遲。
- •該模型整合了情感分析模組,能根據對話語境調整語音的語調、節奏與停頓,以模擬人類的自然反應。
- •微軟在 MAI Playground 中測試該模型時,特別強調了其在嘈雜環境下的語音識別魯棒性(Robustness)。
- •MAI Realtime 的開發與微軟內部代號為 'Project Silica' 的語音優化計畫存在技術關聯,旨在提升邊緣運算設備上的響應速度。
- •該模型支援多模態輸入,允許使用者在語音對話過程中即時上傳圖像或文件,並由模型進行同步語音解讀。
競品分析
架構
- Microsoft MAI Realtime
- 原生全雙工 (端到端)
- OpenAI GPT-4o (Advanced Voice)
- 原生多模態 (端到端)
- Google Gemini Live
- 多模態串流
打斷處理
- Microsoft MAI Realtime
- 極低延遲
- OpenAI GPT-4o (Advanced Voice)
- 極低延遲
- Google Gemini Live
- 低延遲
部署平台
- Microsoft MAI Realtime
- Azure / Foundry
- OpenAI GPT-4o (Advanced Voice)
- ChatGPT Plus / API
- Google Gemini Live
- Gemini Advanced
語言支援
- Microsoft MAI Realtime
- 17 種
- OpenAI GPT-4o (Advanced Voice)
- 50+ 種
- Google Gemini Live
- 40+ 種
| 特性 | Microsoft MAI Realtime | OpenAI GPT-4o (Advanced Voice) | Google Gemini Live |
|---|---|---|---|
| 架構 | 原生全雙工 (端到端) | 原生多模態 (端到端) | 多模態串流 |
| 打斷處理 | 極低延遲 | 極低延遲 | 低延遲 |
| 部署平台 | Azure / Foundry | ChatGPT Plus / API | Gemini Advanced |
| 語言支援 | 17 種 | 50+ 種 | 40+ 種 |
技術深入
- 採用基於 Transformer 的原生音訊編解碼器,直接處理原始音訊波形而非中間文本表示。
- 實作了動態緩衝區管理機制,以在網路波動時維持全雙工對話的連續性。
- 支援自定義語音微調(Fine-tuning),允許企業客戶透過 Microsoft Foundry 導入專屬語音數據。
- 整合了輕量級的 VAD(語音活動檢測)演算法,以精確區分用戶語音與背景噪音。
前景展望基於引用來源的 AI 分析
微軟將在 2026 年底前將 MAI Realtime 整合至 Windows 11 的 Copilot 系統中。
透過將語音模型下放到作業系統層級,微軟能顯著提升 Copilot 的用戶黏著度並降低對雲端 API 的依賴。
MAI Realtime 將成為 Azure AI Speech 服務的核心升級項目。
微軟正積極推動企業級語音解決方案的現代化,以取代舊有的語音轉文字 API 服務。
時間線
2025-05
微軟宣布成立 MAI (Microsoft AI) 專責部門,整合內部語音與多模態研究資源。
2026-02
MAI Playground 平台正式上線,開始小規模測試內部開發的語音模型原型。
2026-06
微軟在 Build 大會上預告將推出更具互動性的語音處理技術,暗示全雙工能力的開發。
- 2025-05微軟宣布成立 MAI (Microsoft AI) 專責部門,整合內部語音與多模態研究資源。
- 2026-02MAI Playground 平台正式上線,開始小規模測試內部開發的語音模型原型。
- 2026-06微軟在 Build 大會上預告將推出更具互動性的語音處理技術,暗示全雙工能力的開發。
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗
每週電子報
每週一封,可隨時退訂。


