千問大模型升級實時語音識別模型 Fun-ASR-Realtime
阿里巴巴千問大模型升級了實時語音識別模型 Fun-ASR-Realtime,該模型首字延遲控制在百毫秒級別。它支援 30 種語言與 16 種方言,識別準確率接近離線模型。
Tag: #asr16 results
阿里巴巴千問大模型升級了實時語音識別模型 Fun-ASR-Realtime,該模型首字延遲控制在百毫秒級別。它支援 30 種語言與 16 種方言,識別準確率接近離線模型。

阿里千問升級了 Fun-ASR-Realtime 模型,現支援 30 種語言與 16 種方言,並具備高識別準確率。該模型已上線阿里雲百煉平台,並實現了百毫秒級的低延遲識別。

NVIDIA 推出了一種利用 Agent Skills 和 Nemotron Speech 來評估臨床自動語音識別 (ASR) 模型的新方法。此解決方案解決了識別複雜醫學術語(如藥物和手術名稱)的困難,這些術語通常是現成語音系統的挑戰。

Cohere 發布 Transcribe,其首款開源自動語音辨識(ASR)模型,參數規模約 20 億。定位輕量級,可在消費級 GPU 運行,針對自託管語音轉文字轉錄及語音內容分析。適合企業與開發者本地部署需求。
Whisper Accent 使用每種口音條件化的自適應層歸一化來調整 OpenAI Whisper 以處理帶口音英語,同時凍結編碼器/解碼器。它支援 20 多種口音,中型模型在測試集上達到 13.4% WER,優於基礎 Whisper。GitHub 上發布完整訓練程式碼、評估流程和檢查點。

NagaTranslate 是一項旨在為印度 Nagaland 的低資源語言(如 Nagamese、Ao 和 Sema)開發翻譯與語音處理管線的計畫。該專案目前採用商業 LLM API、針對 TTS 微調的 VITS 模型以及用於 ASR 的 Whisper 模型。

本研究評估了多語言編碼器與純英語編碼器在串流語音識別(ASR)中的表現。研究發現,多語言初始化僅在數據量較少時具有顯著優勢,隨著目標語言數據量的增加,該優勢會迅速減弱。
Hugging Face 推出了 FFASR 排行榜,旨在評估真實世界條件下的自動語音識別 (ASR) 系統。此舉旨在提供超越標準學術數據集的更準確性能評估。
開發者正在尋求有效的策略來針對技術或特定領域語音(特別是西班牙語)微調 Whisper。討論評估了除標準 LoRA 和 QLoRA 之外,能更好識別詞彙的方法。

本研究評估了 Wav2Vec2.0 和 XLS-R 等自監督 Transformer 模型在古蘭經語音識別(ASR)的應用,顯著降低了詞錯誤率。研究強調了在大型誦讀數據集上進行特定領域微調的有效性。