🏕️极客公园•最新收集於 9h
Microsoft 或打造全雙工語音模型

💡Microsoft 或正準備原生語音模型,挑戰 OpenAI 的即時音訊技術並改變 Azure 的 AI 依賴。
⚡ 30-Second TL;DR
有什麼變化
據報 MAI Realtime 提供全雙工語音互動系統,可同時聆聽與說話。
為什麼重要
若消息屬實,MAI Realtime 將強化 Microsoft 對即時語音基礎設施的掌控,並為開發者提供 OpenAI 即時語音技術之外的選擇。這也可能代表 Microsoft 正更積極地為 Azure 與 Copilot 等戰略工作負載打造自研模型。
下一步行動
留意 MAI Playground 與 Microsoft Foundry 是否正式推出 MAI Realtime 預覽版,並將其延遲、打斷處理與多語言表現與目前使用的語音 API 進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •據報 MAI Realtime 提供全雙工語音互動系統,可同時聆聽與說話。
- •據稱該模型支援包括中文、英文、日文與韓文在內的 17 種語言,並能無縫切換。
- •它據報具備低延遲、自然的打斷處理能力,並提供 Victoria 與 Grant 兩種語音。
- •Microsoft 可能利用該模型降低 Azure 服務對 OpenAI 元件的依賴,並透過 Microsoft Foundry 與 Copilot 部署。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •MAI Realtime 採用端到端(End-to-End)語音處理架構,繞過了傳統語音轉文字(ASR)與文字轉語音(TTS)的串聯延遲。
- •該模型整合了情感分析模組,能根據對話語境調整語音的語調、節奏與停頓,以模擬人類的自然反應。
- •微軟在 MAI Playground 中測試該模型時,特別強調了其在嘈雜環境下的語音識別魯棒性(Robustness)。
- •MAI Realtime 的開發與微軟內部代號為 'Project Silica' 的語音優化計畫存在技術關聯,旨在提升邊緣運算設備上的響應速度。
- •該模型支援多模態輸入,允許使用者在語音對話過程中即時上傳圖像或文件,並由模型進行同步語音解讀。
📊 競品分析▸ Show
| 特性 | Microsoft MAI Realtime | OpenAI GPT-4o (Advanced Voice) | Google Gemini Live |
|---|---|---|---|
| 架構 | 原生全雙工 (端到端) | 原生多模態 (端到端) | 多模態串流 |
| 打斷處理 | 極低延遲 | 極低延遲 | 低延遲 |
| 部署平台 | Azure / Foundry | ChatGPT Plus / API | Gemini Advanced |
| 語言支援 | 17 種 | 50+ 種 | 40+ 種 |
🛠️ 技術深入
- 採用基於 Transformer 的原生音訊編解碼器,直接處理原始音訊波形而非中間文本表示。
- 實作了動態緩衝區管理機制,以在網路波動時維持全雙工對話的連續性。
- 支援自定義語音微調(Fine-tuning),允許企業客戶透過 Microsoft Foundry 導入專屬語音數據。
- 整合了輕量級的 VAD(語音活動檢測)演算法,以精確區分用戶語音與背景噪音。
🔮 前景展望AI analysis grounded in cited sources
微軟將在 2026 年底前將 MAI Realtime 整合至 Windows 11 的 Copilot 系統中。
透過將語音模型下放到作業系統層級,微軟能顯著提升 Copilot 的用戶黏著度並降低對雲端 API 的依賴。
MAI Realtime 將成為 Azure AI Speech 服務的核心升級項目。
微軟正積極推動企業級語音解決方案的現代化,以取代舊有的語音轉文字 API 服務。
⏳ 時間線
2025-05
微軟宣布成立 MAI (Microsoft AI) 專責部門,整合內部語音與多模態研究資源。
2026-02
MAI Playground 平台正式上線,開始小規模測試內部開發的語音模型原型。
2026-06
微軟在 Build 大會上預告將推出更具互動性的語音處理技術,暗示全雙工能力的開發。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗
