💼VentureBeat•最新收集於 32m
Nvidia 路由 AI 任務,大幅降低成本

#model-routing#agent-workflows#mixture-of-experts#inference-costnemotron-3.5-lightning-and-nemo-switchyardnvidianemotron 3.5 lightningnemo switchyardqwen3.6-35bopus 4.8
💡了解 Nvidia 如何結合開放模型與路由器,將前沿模型成本降至三分之一。
⚡ 30-Second TL;DR
有什麼變化
Nemotron 3.5 Lightning 是一款 300 億參數的開放式混合專家模型,針對高流量代理工作負載設計。
為什麼重要
這次發布讓 Nvidia 同時提供降低代理推論成本所需的模型與路由基礎設施。此舉可能促使開發者採用多模型工作流程,而不是將所有任務都交給高價的前沿模型。
下一步行動
使用 NeMo Switchyard 為代表性代理工作流程製作原型,並與僅使用 Opus 的基準比較品質、延遲與成本。
誰應關注:Developers & AI Engineers
關鍵要點
- •Nemotron 3.5 Lightning 是一款 300 億參數的開放式混合專家模型,針對高流量代理工作負載設計。
- •NeMo Switchyard 會將代理工作流程的每個步驟,路由至最適合該步驟的模型。
- •Nvidia 宣稱,在準確度相當的情況下,輸出速度最高快 4 倍,代理任務完成速度約比 Qwen3.6-35B 快 30%。
- •據稱,兩者組合可達到前沿級任務完成率,基準測試成本約為 Opus 4.8 的三分之一。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •NeMo Switchyard 採用了動態路由演算法,能夠根據任務的複雜度與預算限制,即時在不同規模的模型間進行切換,而非僅依賴單一模型。
- •Nemotron 3.5 Lightning 針對 NVIDIA Blackwell 架構進行了底層算子優化,特別是在 FP8 推論精度下展現了極高的吞吐量。
- •該解決方案整合了 NVIDIA NIM 微服務架構,允許開發者透過標準 API 快速部署 Switchyard 路由邏輯,降低了企業級 AI 代理的整合門檻。
- •NVIDIA 在測試中發現,透過 Switchyard 路由至較小模型處理簡單查詢,可顯著減少 GPU 記憶體佔用,進而提升單一伺服器節點的並發處理能力。
- •此技術框架支援異質模型部署,意味著企業可以在同一路由架構下混合使用 NVIDIA 自家模型與第三方開源模型(如 Llama 或 Mistral 系列)。
📊 競品分析▸ Show
| 特性 | NVIDIA NeMo Switchyard | RouteLLM (LMSYS) | Martian Router |
|---|---|---|---|
| 核心定位 | 企業級硬體優化路由 | 開源路由研究框架 | 商業化模型路由 API |
| 硬體整合 | 與 Blackwell/NIM 深度綁定 | 軟體層級無特定硬體要求 | 雲端中立,無硬體優化 |
| 模型支援 | 優先支援 NVIDIA 模型生態 | 廣泛支援各類開源模型 | 支援主流閉源與開源模型 |
| 成本優勢 | 極高(透過硬體加速降低推論成本) | 中(取決於所選模型) | 高(透過模型套利降低 API 費用) |
🛠️ 技術深入
- 路由機制:NeMo Switchyard 使用基於強化學習的路由策略,根據輸入提示詞的語意複雜度與歷史延遲數據進行決策。
- 模型架構:Nemotron 3.5 Lightning 採用混合專家 (MoE) 架構,透過稀疏激活機制,在保持 300 億參數規模的同時,僅需極少量的計算資源即可完成單次推理。
- 精度優化:支援 FP8 與 INT8 量化,並透過 TensorRT-LLM 進行圖形編譯優化,以適應高流量代理工作負載。
- 部署方式:以 NIM (NVIDIA Inference Microservices) 容器化形式提供,支援 Kubernetes 自動擴展與負載平衡。
🔮 前景展望AI analysis grounded in cited sources
AI 代理開發將從「單一大型模型」轉向「路由式混合模型」架構。
隨著成本敏感度提升,企業將更傾向於使用路由技術來平衡效能與預算,而非盲目追求單一模型的規模。
NVIDIA 將透過軟硬體整合進一步鞏固其在 AI 推論市場的護城河。
將路由軟體與 Blackwell 硬體加速深度綁定,將使競爭對手難以在相同的成本效益比下提供類似的推論解決方案。
⏳ 時間線
2024-03
NVIDIA 發表 Blackwell 架構,為後續高效能推論奠定硬體基礎。
2025-02
NVIDIA 推出 NeMo 微服務 (NIM),確立了模型部署與優化的標準化路徑。
2026-05
Nemotron 系列模型更新,開始針對代理工作負載進行特定優化。
2026-08
正式發布 Nemotron 3.5 Lightning 與 NeMo Switchyard,推動路由技術落地。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗



