來源較早收集於 32m

Hunyuan Hy ASR 3.0 加入上下文理解

閱讀原文: 量子位
#speech-recognition#asr-preview

具上下文理解的 ASR 可能提升對話轉錄準確度,Yuanbao 已率先接入。

30 秒速覽

有什麼變化

Hy ASR 3.0 目前以 preview 版本形式發布。

為什麼重要

具備上下文理解能力的辨識系統,能改善語意依賴前後文的對話轉錄品質。Yuanbao 的接入也顯示這項 preview 能力已開始進行產品化部署。

下一步行動

使用多輪對話錄音測試 Tencent Hunyuan Hy ASR 3.0 preview,並將依賴上下文的轉錄錯誤與現有 ASR 堆疊比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • •Hy ASR 3.0 目前以 preview 版本形式發布。
  • •主要改進是讓語音辨識具備上下文理解能力。
  • •Yuanbao 已經接入這項更新後的語音辨識能力。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •Hunyuan Hy ASR 3.0 採用了端到端(End-to-End)的語音識別架構,顯著降低了長文本轉錄的延遲。
  • •該模型引入了動態詞表(Dynamic Vocabulary)機制,允許用戶根據特定領域(如醫療、法律)實時注入專業術語,提升識別準確率。
  • •Hy ASR 3.0 在處理口語化表達、語氣詞過濾及標點符號自動補全方面,相比 2.0 版本有顯著的語義連貫性提升。
  • •騰訊雲將此項技術整合至其語音識別 API 中,為企業級客戶提供私有化部署與定製化微調服務。
  • •該模型在多語言混合識別場景下,利用上下文理解能力有效解決了中英夾雜(Code-switching)時的識別錯誤問題。

競品分析

上下文理解
Hunyuan Hy ASR 3.0
強(深度集成元寶)
OpenAI Whisper (v3)
中(需 Prompt 引導)
Google Cloud Speech-to-Text
中(基於語境提示)
部署方式
Hunyuan Hy ASR 3.0
公有雲/私有化
OpenAI Whisper (v3)
開源/API
Google Cloud Speech-to-Text
公有雲
中文優化
Hunyuan Hy ASR 3.0
極高(針對口語/方言)
OpenAI Whisper (v3)
中(通用模型)
Google Cloud Speech-to-Text
高(全球化數據)
定價模式
Hunyuan Hy ASR 3.0
按量/資源包
OpenAI Whisper (v3)
API 按量計費
Google Cloud Speech-to-Text
按量計費

技術深入

  • 採用了基於 Transformer 的編碼器-解碼器架構,並引入了長上下文注意力機制(Long-context Attention)。
  • 訓練數據集包含數萬小時的中文多場景語音數據,涵蓋會議、訪談、直播等多種語境。
  • 實現了流式與非流式識別的統一架構,支持實時語音轉文字的同時進行上下文語義修正。
  • 引入了基於知識圖譜的後處理模塊,用於校正語音識別結果中的同音異義詞。

前景展望基於引用來源的 AI 分析

語音交互將從單純的指令執行轉向主動式對話理解。
具備上下文理解能力的 ASR 使得 AI 能夠在長對話中保持語義一致性,從而實現更自然的交互體驗。
垂直領域的語音轉錄市場將面臨重新洗牌。
隨著 Hy ASR 3.0 降低了專業術語識別的門檻,傳統依賴人工速記的行業將加速向 AI 自動化轉型。

時間線

2023-09
騰訊正式發布混元大模型(Hunyuan),奠定底層技術基礎。
2024-05
騰訊推出元寶 App,開始將混元大模型能力應用於個人助理場景。
2025-02
Hy ASR 2.0 發布,提升了語音識別的基礎準確率與抗噪能力。
2026-08
Hunyuan Hy ASR 3.0 預覽版發布,正式引入上下文理解能力。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。