🟩NVIDIA Developer Blog•較早收集於 1m
利用 NVIDIA Nemotron Speech 加速臨床 ASR 模型評估

💡了解如何使用 Agent Skills 和 Nemotron Speech 來解決醫療術語在臨床 ASR 中的準確性問題。
⚡ 30-Second TL;DR
有什麼變化
解決標準 ASR 模型在識別專業臨床術語時的高錯誤率問題。
為什麼重要
此工具顯著減少了開發人員為醫療應用微調和驗證語音模型所需的時間與精力。它確保了臨床環境中的更高可靠性,這對於病患安全至關重要的轉錄準確性來說至關重要。
下一步行動
將 NVIDIA Nemotron Speech 整合到您的評估流程中,以針對複雜的醫學術語對您目前的臨床 ASR 模型進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •解決標準 ASR 模型在識別專業臨床術語時的高錯誤率問題。
- •利用 Agent Skills 自動化醫療語音 AI 的評估流程。
- •利用 NVIDIA Nemotron Speech 提高合成和識別複雜藥物與解剖名稱的準確性。
- •專注於縮小流暢語音與臨床準確性之間的差距。
🧠 深度解析
Web-grounded analysis with 16 cited sources.
🔑 增強重點摘要
- •NVIDIA Nemotron Speech 模型是 NVIDIA 專為代理式 AI (agentic AI) 設計的開放式 AI 模型家族的一部分,旨在支援多模態工作負載,包括推理、視覺理解、語音和檢索增強生成 (RAG)。
- •Nemotron Speech ASR 模型,特別是 Nemotron 3.5 ASR,是一個 6 億參數的串流自動語音識別模型,能夠從單一檢查點即時轉錄 40 種語言區域,並內建標點符號和大小寫功能。
- •該模型採用 Cache-Aware FastConformer-RNNT 架構,透過重複使用快取編碼器上下文來消除傳統「緩衝」串流中常見的冗餘重疊計算,顯著提高計算效率並最大限度地減少端到端延遲,同時不犧牲準確性。
- •Nemotron Speech ASR 提供可配置的延遲設定,例如 80 毫秒、160 毫秒、320 毫秒、560 毫秒和 1.12 秒,使用者可以在推論時調整這些設定以平衡準確性和速度,而無需重新訓練模型。
- •NVIDIA 的 Agent Skills 是可攜式指令集,可擴展 AI 代理的功能,包括部署、配置、評估和故障排除 Nemotron Speech (Riva ASR/TTS/NMT NIMs) 以及臨床 ASR 評估和微調工作流程。
📊 競品分析▸ Show
| 特性/產品 | NVIDIA Nemotron Speech (臨床 ASR) | Deepgram Nova-3 Medical | AssemblyAI (醫療模式) | AWS Transcribe Medical + HealthScribe | Google Cloud Speech-to-Text (醫療模型) | Nuance Dragon Medical SpeechKit |
|---|---|---|---|---|---|---|
| 主要優勢 | 專為複雜醫學術語設計,低延遲串流,可配置的準確度/延遲權衡,開放權重模型,與 Agent Skills 整合實現自動評估。 | 專為醫療詞彙優化,低延遲、高吞吐量,清晰的 API 和按分鐘計費。 | 開發者友好平台,具備醫療模式和強大的音訊智慧功能,提供 BAA。 | 適用於已在 AWS 生態系統中的用戶,提供醫療轉錄和健康筆記生成。 | 適用於已在 Google Cloud 生態系統中的用戶,提供醫療轉錄模型。 | 醫療語音識別的市場領導者,高度專業化和準確性。 |
| 準確度 (WER) | 在標準基準測試中與最佳商業 ASR 模型相當,優於 Whisper,平均 WER 達 6.05% (Nemotron 3 ASR)。 | 針對臨床詞彙進行優化,高準確度。 | 需在用戶自己的臨床音訊上進行基準測試以確認。 | 針對醫療領域優化。 | 針對醫療領域優化,但覆蓋範圍可能較窄。 | 以高準確度著稱,尤其是在醫療領域。 |
| 延遲 | 超低延遲串流,最終轉錄時間可低於 24 毫秒,可配置的延遲選項。 | 低延遲串流。 | 提供低延遲。 | 適用於即時和批次處理。 | 適用於即時和批次處理。 | 針對即時醫療聽寫進行優化。 |
| 多語言支援 | Nemotron 3.5 ASR 支援 40 種語言區域。 | 主要針對英語,但可能支援其他語言。 | 支援多種語言。 | 支援多種語言。 | 支援多種語言,但醫療模型可能有限制。 | 支援多種語言。 |
| 部署 | 作為開放權重模型在 Hugging Face 和 NVIDIA NGC 上提供,可自託管,支援 NVIDIA GPU 加速系統。 | 基於 API 的雲端服務。 | 基於 API 的雲端服務。 | 雲端服務。 | 雲端服務。 | 通常為企業級解決方案,可雲端或本地部署。 |
| 定價模式 | 開放權重模型,可自託管,降低高流量工作負載的每 API 呼叫成本。 | 基於使用量的按分鐘計費。 | 提供 BAA,通常為基於使用量的定價。 | 基於使用量的雲端服務定價。 | 基於使用量的雲端服務定價。 | 通常為企業級許可或訂閱模式。 |
🛠️ 技術深入
- 模型架構: Nemotron Speech ASR 模型基於 Cache-Aware FastConformer-RNNT 架構。
- 參數數量: Nemotron 3.5 ASR 是一個 6 億參數的串流 ASR 模型。
- 編碼器: 採用 FastConformer 編碼器,包含 24 個編碼器層,具有 1024 個隱藏維度。
- 解碼器: 使用 RNNT (Recurrent Neural Network Transducer) 解碼器。
- 快取感知串流: 該設計透過維護先前音訊塊的編碼表示的滾動快取,來消除冗餘的重疊計算。當新的音訊塊到達時,模型會將其與對話中較早的快取上下文一起處理,從而提高計算效率並最大限度地減少端到端延遲。
- 可配置延遲: 透過調整
att_context_size推論設定,模型可以在 80 毫秒、160 毫秒、320 毫秒、560 毫秒和 1.12 秒等不同塊大小之間進行操作,以實現延遲-準確度權衡,無需重新訓練。 - 訓練資料: Nemotron 3 ASR (英文版) 經過約 250,000 小時的美國英語 (en-US) 語音資料集 ASRSet 訓練。
- 軟體整合: Nemotron Speech 模型與 NVIDIA NeMo 框架整合,該框架是一個用於構建自訂生成式 AI 模型的開發平台,支援 ASR、NLP 和 TTS。
- 代理技能 (Agent Skills): 作為可攜式指令集,Agent Skills 能夠教導 AI 代理如何正確使用 NVIDIA CUDA-X 函式庫、AI 藍圖和 NeMo 訓練與推論工具,並特別支援 Nemotron Speech (Riva ASR/TTS/NMT NIMs) 和臨床 ASR 評估與微調工作流程。
- 硬體要求 (Nemotron Voice Agent 藍圖): 部署 Nemotron Voice Agent 藍圖需要 2 個 NVIDIA GPU (Ampere、Hopper、Ada 或更新版本),其中一個 GPU 用於 ASR 和 TTS 模型 (總共 48 GB VRAM),另一個 GPU 用於 LLM NIM (Nemotron 3 Nano 30B A3B 需要 48 GB VRAM,Llama 3.3 Nemotron Super 49B v1.5 需要 80 GB VRAM)。
🔮 前景展望AI analysis grounded in cited sources
醫療保健領域將加速採用 AI 代理來自動化行政任務。
Nemotron Speech 與 Agent Skills 的結合,使 AI 代理能夠更準確、高效地處理複雜的醫療語音,從而減少醫護人員的行政負擔並提高效率。
臨床文件和患者護理的準確性和效率將顯著提高。
透過 Nemotron Speech 在識別複雜醫學術語方面的改進,以及其低延遲和高準確度的特性,將使醫療專業人員能夠更快速、更精確地記錄資訊,從而改善患者護理。
多模態 AI 解決方案將在醫療保健領域得到更廣泛的整合,以提供更全面的支援。
Nemotron 家族模型支援多模態工作負載,包括語音、語言和視覺理解,這將促進開發能夠處理多種輸入類型並提供更全面醫療支援的 AI 系統。
⏳ 時間線
2023-12
NVIDIA NeMo 框架作為對話式 AI 的開源工具包發布,支援 ASR、NLP 和 TTS。
2025-01
NVIDIA 透過與 IQVIA、Mayo Clinic 等主要醫療保健合作夥伴擴大其醫療保健 AI 計劃。
2026-01
NVIDIA 發布 Nemotron Speech ASR (英文,0.6B 參數),專為低延遲語音代理設計。
2026-03
NVIDIA Nemotron 3 VoiceChat (12B) 發布,用於端到端語音到語音對話式 AI。
2026-03
NVIDIA Nemotron Speech Realtime 容器 (包括 Nemotron 3 ASR) 在 NGC 上發布,提供即時語音識別功能。
2026-06
NVIDIA Nemotron 3.5 ASR (多語言,600M 參數) 發布,支援 40 種語言區域的即時串流轉錄。
📎 來源 (16)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗