
豆包輸入法 HarmonyOS 版開放搶先體驗
豆包輸入法 HarmonyOS 版已在 AppGallery 開放搶先體驗,版本號為 0.9.1,體驗時間為 8 月 22 日至 9 月 21 日。此版本支援基於豆包語音大型模型的多方言、英語及中英混輸,並提供弱網環境下的語音輸入能力。
Tag: #speech-recognition34 results

豆包輸入法 HarmonyOS 版已在 AppGallery 開放搶先體驗,版本號為 0.9.1,體驗時間為 8 月 22 日至 9 月 21 日。此版本支援基於豆包語音大型模型的多方言、英語及中英混輸,並提供弱網環境下的語音輸入能力。

Apple 提出一套用於中英語碼轉換自動語音辨識的迭代式偽標籤方法。該方法透過偽標籤生成、雙語模型訓練與反覆優化,利用未標註語音資料來解決語碼轉換訓練資料有限的問題。
Hugging Face 探討基準測試最佳化如何影響語音辨識系統的評估。文章聚焦於衡量基準表現是否反映模型的真正進步,或只是對評估流程的適應。

Rotherham 的 GP 診所已導入支援 17 種語言的 AI 接待員 Emma。Healthwatch Rotherham 表示,系統難以理解當地濃厚口音,令部分患者感到沮喪並直接掛斷電話。

多家中國科技巨頭發布重要AI更新,包括阿里巴巴的實時語音識別模型Fun-ASR-Realtime、騰訊混元Hy3模型,以及美團LongCat-2.0的開源。
Google Pixel 11 Pro 與 Pixel 11 Pro XL 帶來表現出色的語音輸入,以及其他軟體改進。然而,遊戲效能不足與實用性低落的背面 LED,讓這兩款手機未能成為大幅超越前代的旗艦升級。

NVIDIA 的 NeMo-Speech.cpp 支援在本機執行經 GGUF 量化的語音辨識、文字轉語音與編解碼元件。列出的堆疊包括 Magpie-TTS、Nemotron Speech、Nemotron ASR、Parakeet 模型及 NanoCodec。

阿里巴巴發布了全新的即時語音大模型 Qwen-Audio-3.0-Realtime。此次更新針對速度與智慧化能力進行了四項關鍵功能升級。

阿里千問升級了 Fun-ASR-Realtime 模型,現支援 30 種語言與 16 種方言,並具備高識別準確率。該模型已上線阿里雲百煉平台,並實現了百毫秒級的低延遲識別。

NVIDIA 推出了一種利用 Agent Skills 和 Nemotron Speech 來評估臨床自動語音識別 (ASR) 模型的新方法。此解決方案解決了識別複雜醫學術語(如藥物和手術名稱)的困難,這些術語通常是現成語音系統的挑戰。