🗾ITmedia AI+ (日本)•最新收集於 63m
Meta 推出即時多語音訊模型
#speech-recognition#speaker-diarization#multilingual-audio#real-time-aimuse-voice-transcribemetamuse voice transcribemeta model apimeta ai
💡Meta 首款即時模型整合轉錄、說話者追蹤與回合偵測,適合多語言應用。
⚡ 30-Second TL;DR
有什麼變化
單一模型可處理語音辨識、說話者分離與發話結束偵測。
為什麼重要
這項發布可透過將多項音訊處理功能整合至單一模型,簡化即時會議、客服中心與協作語音應用的架構。多語言說話者追蹤也可能提升跨國團隊及混合語言工作流程的轉錄品質。
下一步行動
透過 Meta Model API 使用 Muse Voice Transcribe 建立多語言會議轉錄原型,並重點測試說話者辨識準確度與回合結束判定。
誰應關注:Developers & AI Engineers
關鍵要點
- •單一模型可處理語音辨識、說話者分離與發話結束偵測。
- •可在即時對話中辨識 20 名以上的說話者。
- •支援包含日文在內的多語言及語碼混用音訊。
- •可透過 Meta Model API、Mac 版 Meta AI 應用程式與 Muse Code 使用。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •Muse Voice Transcribe 採用「自適應延遲」(Adaptive Delay)技術,能根據語音複雜度動態調整處理上下文的長度,以平衡即時性與準確度。
- •該模型在發布時已針對 70 種語言進行訓練,並完成其中 25 種語言的效能驗證,特別強化了語碼混用(Code-switching)的處理能力。
- •根據 2026 年 9 月的數據,該模型在 Artificial Analysis 的串流語音轉文字排行榜上位居首位。
- •與 Meta 過往傾向開源的策略不同,Muse Voice Transcribe 採取閉源策略,並未釋出模型權重。
- •開發者使用該模型的 API 成本為每 1,000 分鐘音訊 3 美元,換算約為每小時 0.18 美元。
📊 競品分析▸ Show
| 特色/項目 | Muse Voice Transcribe (Meta) | Gemini 3.5 Transcribe (Google) |
|---|---|---|
| 核心優勢 | 整合式即時處理、自適應延遲 | 深度多模態整合、生態系支援 |
| 價格 | $3 / 1,000 分鐘 | 視 Google Cloud 定價而定 |
| 效能排名 | Artificial Analysis 排行榜第一 | 業界領先水準 |
🛠️ 技術深入
- 採用單一整合架構,同時執行串流自動語音辨識 (ASR)、說話者分離 (Diarization) 與發話結束偵測 (Endpointing)。
- 引入自適應延遲技術,動態決定處理音訊上下文的時長,以優化處理速度與辨識精確度。
- 支援超過 20 名說話者的即時追蹤與辨識。
- 針對多語言混合環境進行優化,特別是針對語句間或語句內的語言切換場景。
🔮 前景展望AI analysis grounded in cited sources
Meta 將透過此模型大幅提升 Meta AI 在 macOS 系統層級的語音互動體驗。
該模型已直接整合至 Meta AI macOS 應用程式,將取代現有的基礎聽寫功能,提供更精準的即時轉錄。
Meta 將在語音辨識市場採取更積極的商業化定價策略。
每小時 0.18 美元的定價顯示 Meta 意圖透過具競爭力的價格,從 Google 與 OpenAI 手中爭奪企業級語音轉錄市場份額。
⏳ 時間線
2025-12
Meta 發布 Omnilingual ASR 語音辨識套件。
2026-09
Meta 發表 Muse Voice Transcribe 即時語音辨識模型。
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗
每週 AI 簡報
每週一封,可隨時退訂。

