來源Pandaily•最新收集於 15h
Alibaba 擴充 Qwen Audio 並加速翻譯

#speech-recognition#text-to-speechqwen-audio-suitealibabaqwen3.8-livetranslateqwen-audio-3.1qwen
Qwen 音訊產品線同時瞄準低延遲翻譯與更廣泛的語音工作負載。
30 秒速覽
有什麼變化
Qwen3.8-LiveTranslate 將 LAAL 延遲從約 2.8 秒降至 2.3 秒。
為什麼重要
更低的翻譯延遲可能改善即時多語對話與會議體驗。更完整的音訊產品線則為語音應用與創意製作提供更多專用選項。
下一步行動
使用 Qwen3.8-LiveTranslate 建立即時多語通話原型,並測量端到端延遲,不要只依賴據報的 LAAL 數值。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.8-LiveTranslate 將 LAAL 延遲從約 2.8 秒降至 2.3 秒。
- •Qwen-Audio-3.1 包含 ASR、TTS 與 Realtime 版本。
- •TTS-Next 針對電影感聲景生成。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 13 個來源。
增強重點摘要
- •Qwen3.8-LiveTranslate 放棄傳統多階段流程(ASR → MT → TTS),改採交錯架構(Interleave architecture),將即時口譯視為單一連續音訊文字串流並進行即時快取重用。
- •該模型內建即時說話者分離與辨識功能,能在多方對話中識別說話者,並穩定複製其音色輸出至翻譯語言中以維持聲音一致性。
- •翻譯系統支援同步雙語串流輸出,同時呈現來源語音轉錄與翻譯文字,並透過長上下文消歧技術確保專有名詞與專業術語的一致性。
- •阿里巴巴透過百煉(Model Studio / DashScope)提供 WebSocket 即時 API,具備伺服器端語音活動檢測(VAD)與智慧輪替判定,支援可打斷的企業級語音助理。
- •阿里巴巴在音訊 API 費率上實施大幅降價,部分音訊層級降幅高達 95%,正面迎戰 OpenAI GPT-4o Realtime 與 Google Gemini Live。
競品分析
核心架構
- Alibaba Qwen3.8-LiveTranslate / Qwen-Audio-3.1
- 原生交錯串流架構(Interleave architecture)
- OpenAI GPT-4o Realtime API
- 原生端到端多模態模型
- Google Gemini Live
- 原生端到端多模態模型
口譯延遲指標
- Alibaba Qwen3.8-LiveTranslate / Qwen-Audio-3.1
- LAAL 延遲約 2.3 秒
- OpenAI GPT-4o Realtime API
- 語音端到端延遲約 300-500ms(對話)
- Google Gemini Live
- 語音端到端低延遲對話
音色克隆與分離
- Alibaba Qwen3.8-LiveTranslate / Qwen-Audio-3.1
- 支援即時說話者分離與跨語言音色複製
- OpenAI GPT-4o Realtime API
- 預設固定多模態音色
- Google Gemini Live
- 預設固定語音輸出選項
聲景與音效生成
- Alibaba Qwen3.8-LiveTranslate / Qwen-Audio-3.1
- 支援 TTS-Next 電影級語音與環境聲效融合
- OpenAI GPT-4o Realtime API
- 主要專注於對話與語氣模擬
- Google Gemini Live
- 專注於自然語音對話輸出
定價策略
- Alibaba Qwen3.8-LiveTranslate / Qwen-Audio-3.1
- 大幅降價(音訊 Token 費率調降高達 95%)
- OpenAI GPT-4o Realtime API
- 較高(專有高階定價)
- Google Gemini Live
- 整合於 Google Cloud / Gemini 企業方案
| 指標 / 方案 | Alibaba Qwen3.8-LiveTranslate / Qwen-Audio-3.1 | OpenAI GPT-4o Realtime API | Google Gemini Live |
|---|---|---|---|
| 核心架構 | 原生交錯串流架構(Interleave architecture) | 原生端到端多模態模型 | 原生端到端多模態模型 |
| 口譯延遲指標 | LAAL 延遲約 2.3 秒 | 語音端到端延遲約 300-500ms(對話) | 語音端到端低延遲對話 |
| 音色克隆與分離 | 支援即時說話者分離與跨語言音色複製 | 預設固定多模態音色 | 預設固定語音輸出選項 |
| 聲景與音效生成 | 支援 TTS-Next 電影級語音與環境聲效融合 | 主要專注於對話與語氣模擬 | 專注於自然語音對話輸出 |
| 定價策略 | 大幅降價(音訊 Token 費率調降高達 95%) | 較高(專有高階定價) | 整合於 Google Cloud / Gemini 企業方案 |
技術深入
- 交錯串流架構(Interleave Architecture):捨棄「語音識別 → 機器翻譯 → 語音合成」的三階段管線,將即時同聲傳譯整合為單一連續的音訊-文字交錯串流處理,快取先前聽取的音訊特徵並即時重用。
- 即時說話者分離與音色遷移:在串流中嵌入說話者日記化(Diarization)模組,可自動追蹤對話參與者切換,並以低延遲特徵提取技術將原始說話者的音色特徵直接合成至目標語音。
- 雙語同步對齊串流:輸出端具備時間戳記對齊機制,提供原文逐字稿與目標譯文的並行即時串流展示,並依賴長上下文注意力機制降低多義詞誤翻。
- 智慧會話輪替與打斷機制:整合伺服器端語音活動檢測(VAD)與語義輪替檢測(Smart Turn Detection),可在全雙工對話下實現毫秒級中斷響應。
前景展望基於引用來源的 AI 分析
跨國會議與跨國電商直播將全面轉向端到端低延遲同聲傳譯方案
2.3 秒的 LAAL 延遲配合即時音色保留與多方對話分離,已能滿足大部分商務即時交流體驗。
影視與有聲書內容製作成本將顯著下降
單一腳本即可同時生成對白與動態環境音效的 TTS-Next 模型,將大幅簡化後製聲效設計流程。
即時語音 AI API 市場將爆發價格戰
阿里巴巴最高 95% 的 API 價格降幅將迫使競爭對手調降語音 Token 價格以防開發者流失。
時間線
2025-11
阿里巴巴發表 Qwen3-LiveTranslate,支援 18 種語言之即時口譯
2026-05
推出 Qwen3.5-LiveTranslate-Flash,擴充至 60 種語言並具備視覺上下文理解能力
2026-09
雲棲大會 2026 正式發布 Qwen3.8-LiveTranslate 與 Qwen-Audio-3.1 系列全套件
- 2025-11阿里巴巴發表 Qwen3-LiveTranslate,支援 18 種語言之即時口譯
- 2026-05推出 Qwen3.5-LiveTranslate-Flash,擴充至 60 種語言並具備視覺上下文理解能力
- 2026-09雲棲大會 2026 正式發布 Qwen3.8-LiveTranslate 與 Qwen-Audio-3.1 系列全套件
來源 (13)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1Alibaba Qwen Livetranslate Audio 3 1 Asr Tts Realtimepandaily.com2Alibaba Qwen Team Releases Qwen3 8 Livetranslatemarktechpost.com3Blogqwen.ai4Alibaba Launches Qwen Audio 3 1 Realtime Plus 262k Context Real Time Voice Agentsdatastudios.org5Ncfc872038cf8note.com6aliyun.comhelp.aliyun.com7Blogqwen.ai8Blogqwen.ai9Alibaba Launches Qwen3 5 Omni Multimodal Modelpandaily.com10Qwen3 8 Omni Flash Native Omni Modelpandaily.com11Qwenalibabacloud.com12Alibaba Launches Qwen Audio 3 1 with Five New Models and Slashes AI Audio Prices by Up to 95 Percentthe-decoder.com13Exploring Trends of AI and Machine Learningcreative-wisdom.me
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
每週電子報
每週一封,可隨時退訂。


