🟩NVIDIA Developer Blog•較早收集於 31m
Run:ai 與 NIM 提升 GPU 使用率

#gpu-scheduling#llm-inferencenvidia-run:ai-&-nimnvidiarun:ainim
💡解決 LLM 推理 GPU 浪費:Run:ai + NIM 打包多樣模型達最大利用率。(38字)
⚡ 30-Second TL;DR
有什麼變化
多樣 LLM 推理需求導致 GPU 平均低利用率。
為什麼重要
擴展 LLM 推理的企業可透過最小化閒置資源提升 GPU 投資報酬率。這在 AI 運算需求激增與成本壓力下至關重要。
下一步行動
試用 NVIDIA Run:ai 以排程 NIM 容器處理您的 LLM 推理工作負載。
誰應關注:Enterprise & Security Teams
關鍵要點
- •多樣 LLM 推理需求導致 GPU 平均低利用率。
- •Run:ai 支援混合工作負載的動態排程與 GPU 分割。
- •NIM 提供優化容器以無縫部署模型。
- •組合降低運算成本與延遲變異性。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •NVIDIA Run:ai 在基準測試中展示了相比傳統 Kubernetes 調度器高達 2 倍的並發用戶容量提升,同時在 64 GPU 規模下對原生 Kubernetes 的性能開銷為零[1]
- •動態 GPU 分割功能允許工作負載在保證最低資源配額的同時,動態調整至更高限制,由 Run:ai 的 GPUOOMKiller 組件確保服務品質隔離[2]
- •NIM 微服務架構整合了 TensorRT GPU 加速、Triton Inference Server 批次處理與 vLLM 推理引擎的生產級優化配置,無需手動 GPU 記憶體優化[6]
- •Run:ai v2.20 新增多 GPU 分割支援,使單一工作負載可利用多個分割 GPU,同時支援跨多 GPU 的記憶體交換以最大化利用率[5]
- •在混合工作負載場景中,TTFT(首個令牌時間)降低 3 倍而吞吐量僅下降 0.4 倍,證明分割部署相比單一 NIM Pod 每 GPU 的效率優勢[1]
🛠️ 技術深入
- •GPU 分割架構:Run:ai 支援動態 GPU 分割,允許工作負載指定保證的 GPU 記憶體與計算資源配額(Request),以及可動態利用的上限(Limit),由調度器自動管理狀態轉換[2]
- •記憶體隔離機制:GPUOOMKiller 組件基於 Kubernetes 語義強制執行資源隔離,防止異構工作負載間的交叉干擾,確保公平的服務品質[1]
- •推理優化堆疊:NIM 整合 TensorRT(GPU 加速)、Triton Inference Server(請求批次處理)與 vLLM(LLM 推理),提供預配置的生產級優化[6]
- •多 GPU 動態分割:v2.20 支援單一工作負載跨多個分割 GPU 運行,每個節點的交換調度器確保分散式模型的 GPU 同步執行[5]
- •自動擴展機制:推理工作負載支援基於延遲(毫秒)、吞吐量或並發用戶數的自動副本擴展,動態調整最小與最大副本數[4]
- •模型配置檔案:NIM 模型配置檔案定義相容的推理引擎與選擇標準(精度、延遲/吞吐量優化、GPU 需求),優先採用量化配置(如 fp8)以降低記憶體使用[4]
🔮 前景展望AI analysis grounded in cited sources
GPU 分割技術將成為企業推理部署的標準配置
2 倍並發用戶容量提升與零性能開銷的基準測試結果表明,分割部署已達生產就緒水準,預期將推動行業採納率提升。
多 GPU 動態分割將擴展至更複雜的分散式訓練場景
v2.20 新增的多 GPU 分割與記憶體交換支援目前聚焦推理工作負載,但技術架構可延伸至訓練工作負載的資源共享。
NIM 標準化 API 將加速異構模型部署的生態整合
每個 NIM 微服務暴露標準化 API 與預優化配置,降低模型部署複雜度,預期將吸引更多第三方框架與平台的整合。
⏳ 時間線
2024-Q4
NVIDIA Run:ai 推出動態 GPU 分割功能,支援工作負載動態調整資源使用
2025-Q1
Run:ai v2.20 發布,新增多 GPU 分割與多 GPU 記憶體交換支援
2025-Q2
NVIDIA NIM 推理工作負載部署功能在 Run:ai UI 中上線,支援自動擴展與 GPU 分割
2025-Q3
NVIDIA 與 Nebius AI Cloud 聯合基準測試驗證 Run:ai 在 Llama 3.1 8B 推理中的 2 倍並發容量提升
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- developer.nvidia.com — Unlock Massive Token Throughput with GPU Fractioning in Nvidia Runai
- docs.run.ai — Dynamic GPU Fractions
- docs.run.ai — Overview
- docs.run.ai — Nim Inference
- run-ai-docs.nvidia.com — Whats New 2 20
- h2o.ai — Why Nvidia Nim Accelerates Your AI Development Pipeline
- developers.redhat.com — How Set Nvidia Nim Red Hat Openshift AI
- blogs.oracle.com — Running Nim on Oke for LLM Inference
- nebul.com — Nvidia Nim Offers Optimized Inference Services for Deploying AI Models at Scale
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。