騰訊會議推出AI同傳功能
騰訊會議正式上線「AI同傳」功能。該功能支援即時語音識別與翻譯,延遲低於3秒,首期提供中英雙向互譯。
Tag: #speech-recognition34 results
騰訊會議正式上線「AI同傳」功能。該功能支援即時語音識別與翻譯,延遲低於3秒,首期提供中英雙向互譯。

Corti 發布了專為臨床環境設計的 Symphony for Speech-to-Text 模型,在醫療術語識別方面顯著優於 OpenAI 的 Whisper 等通用模型。該模型旨在為醫療工作流程中的自主 AI 代理提供可靠的數據基礎。

微軟公布三款自家機器學習模型的公開預覽版,專注於語音辨識、語音合成及影像生成。此舉使微軟儘管與 OpenAI 合作,仍成為其競爭對手。
Hugging Face 推出 Granite 4.0 1B Speech,這是一個緊湊的 1B 參數語音模型,支持多語言。專為邊緣設備設計,可實現高效的設備端語音處理。適合需要低延遲的行動裝置和 IoT 應用。

Mistral AI 發表了 Voxtral Transcribe 2,這是一款可在本地運行的日語支援語音辨識模型。它包含兩個變體:一個針對高精度、低成本的批次處理,另一個針對超低延遲的即時轉錄。
Whisper Accent 使用每種口音條件化的自適應層歸一化來調整 OpenAI Whisper 以處理帶口音英語,同時凍結編碼器/解碼器。它支援 20 多種口音,中型模型在測試集上達到 13.4% WER,優於基礎 Whisper。GitHub 上發布完整訓練程式碼、評估流程和檢查點。

Tencent 預覽了 Hunyuan Hy ASR 3.0,這項自動語音辨識更新旨在於轉錄過程中理解上下文。該能力已經接入 Yuanbao。

本研究評估了多語言編碼器與純英語編碼器在串流語音識別(ASR)中的表現。研究發現,多語言初始化僅在數據量較少時具有顯著優勢,隨著目標語言數據量的增加,該優勢會迅速減弱。
Hugging Face 推出了 FFASR 排行榜,旨在評估真實世界條件下的自動語音識別 (ASR) 系統。此舉旨在提供超越標準學術數據集的更準確性能評估。

本研究評估了 Wav2Vec2.0 和 XLS-R 等自監督 Transformer 模型在古蘭經語音識別(ASR)的應用,顯著降低了詞錯誤率。研究強調了在大型誦讀數據集上進行特定領域微調的有效性。