🟩較早收集於 31m

Run:ai 與 NIM 提升 GPU 使用率

Run:ai 與 NIM 提升 GPU 使用率
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog
#gpu-scheduling#llm-inferencenvidia-run:ai-&-nimnvidiarun:ainim

💡解決 LLM 推理 GPU 浪費:Run:ai + NIM 打包多樣模型達最大利用率。(38字)

⚡ 30-Second TL;DR

有什麼變化

多樣 LLM 推理需求導致 GPU 平均低利用率。

為什麼重要

擴展 LLM 推理的企業可透過最小化閒置資源提升 GPU 投資報酬率。這在 AI 運算需求激增與成本壓力下至關重要。

下一步行動

試用 NVIDIA Run:ai 以排程 NIM 容器處理您的 LLM 推理工作負載。

誰應關注:Enterprise & Security Teams

關鍵要點

  • 多樣 LLM 推理需求導致 GPU 平均低利用率。
  • Run:ai 支援混合工作負載的動態排程與 GPU 分割。
  • NIM 提供優化容器以無縫部署模型。
  • 組合降低運算成本與延遲變異性。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • NVIDIA Run:ai 在基準測試中展示了相比傳統 Kubernetes 調度器高達 2 倍的並發用戶容量提升,同時在 64 GPU 規模下對原生 Kubernetes 的性能開銷為零[1]
  • 動態 GPU 分割功能允許工作負載在保證最低資源配額的同時,動態調整至更高限制,由 Run:ai 的 GPUOOMKiller 組件確保服務品質隔離[2]
  • NIM 微服務架構整合了 TensorRT GPU 加速、Triton Inference Server 批次處理與 vLLM 推理引擎的生產級優化配置,無需手動 GPU 記憶體優化[6]
  • Run:ai v2.20 新增多 GPU 分割支援,使單一工作負載可利用多個分割 GPU,同時支援跨多 GPU 的記憶體交換以最大化利用率[5]
  • 在混合工作負載場景中,TTFT(首個令牌時間)降低 3 倍而吞吐量僅下降 0.4 倍,證明分割部署相比單一 NIM Pod 每 GPU 的效率優勢[1]

🛠️ 技術深入

  • GPU 分割架構:Run:ai 支援動態 GPU 分割,允許工作負載指定保證的 GPU 記憶體與計算資源配額(Request),以及可動態利用的上限(Limit),由調度器自動管理狀態轉換[2]
  • 記憶體隔離機制:GPUOOMKiller 組件基於 Kubernetes 語義強制執行資源隔離,防止異構工作負載間的交叉干擾,確保公平的服務品質[1]
  • 推理優化堆疊:NIM 整合 TensorRT(GPU 加速)、Triton Inference Server(請求批次處理)與 vLLM(LLM 推理),提供預配置的生產級優化[6]
  • 多 GPU 動態分割:v2.20 支援單一工作負載跨多個分割 GPU 運行,每個節點的交換調度器確保分散式模型的 GPU 同步執行[5]
  • 自動擴展機制:推理工作負載支援基於延遲(毫秒)、吞吐量或並發用戶數的自動副本擴展,動態調整最小與最大副本數[4]
  • 模型配置檔案:NIM 模型配置檔案定義相容的推理引擎與選擇標準(精度、延遲/吞吐量優化、GPU 需求),優先採用量化配置(如 fp8)以降低記憶體使用[4]

🔮 前景展望AI analysis grounded in cited sources

GPU 分割技術將成為企業推理部署的標準配置
2 倍並發用戶容量提升與零性能開銷的基準測試結果表明,分割部署已達生產就緒水準,預期將推動行業採納率提升。
多 GPU 動態分割將擴展至更複雜的分散式訓練場景
v2.20 新增的多 GPU 分割與記憶體交換支援目前聚焦推理工作負載,但技術架構可延伸至訓練工作負載的資源共享。
NIM 標準化 API 將加速異構模型部署的生態整合
每個 NIM 微服務暴露標準化 API 與預優化配置,降低模型部署複雜度,預期將吸引更多第三方框架與平台的整合。

時間線

2024-Q4
NVIDIA Run:ai 推出動態 GPU 分割功能,支援工作負載動態調整資源使用
2025-Q1
Run:ai v2.20 發布,新增多 GPU 分割與多 GPU 記憶體交換支援
2025-Q2
NVIDIA NIM 推理工作負載部署功能在 Run:ai UI 中上線,支援自動擴展與 GPU 分割
2025-Q3
NVIDIA 與 Nebius AI Cloud 聯合基準測試驗證 Run:ai 在 Llama 3.1 8B 推理中的 2 倍並發容量提升
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。