🟩較早收集於 20m

NVIDIA Dynamo Snapshot:加速 Kubernetes 推論工作負載啟動

NVIDIA Dynamo Snapshot:加速 Kubernetes 推論工作負載啟動
PostLinkedIn
🟩閱讀原文: NVIDIA Developer Blog

💡別再讓 GPU 空轉等待冷啟動。了解如何讓您的 Kubernetes 推論副本實現即時擴展。

⚡ 30-Second TL;DR

有什麼變化

縮短 Kubernetes 上推論工作負載的冷啟動時間

為什麼重要

此功能透過在自動擴展期間將延遲降至最低,直接提升了 LLM 和推論服務的營運效率。它使基礎設施團隊能夠在不超額配置昂貴 GPU 資源的情況下維持高效能。

下一步行動

評估您目前的 Kubernetes 推論擴展延遲,並測試 NVIDIA Dynamo Snapshot 以減少冷啟動開銷。

誰應關注:Developers & AI Engineers

關鍵要點

  • 縮短 Kubernetes 上推論工作負載的冷啟動時間
  • 防止彈性擴展期間的 GPU 空轉
  • 提升流量高峰期間的服務層級協議 (SLA) 達成率

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • NVIDIA Dynamo Snapshot 是一項實驗性功能,目前處於預覽階段,需要特定的 Kubernetes 設定並以特權 DaemonSet 模式執行,以進行 CRIU 操作。
  • 此解決方案結合了 CRIU(使用者空間檢查點/恢復)來處理 CPU 端狀態,以及 NVIDIA 的 cuda-checkpoint 工具來處理 GPU 端狀態,包括 CUDA 上下文和設備記憶體。
  • Dynamo Snapshot 將大型模型在 Kubernetes 上的冷啟動時間從數分鐘大幅縮短至約 10 秒的熱啟動(從檢查點恢復)時間,顯著提升了效率。
  • 目前,Dynamo Snapshot 主要支援 vLLM 和 SGLang 後端用於大型語言模型 (LLM) 工作負載,但尚未支援 TensorRT-LLM,且目前僅限於單 GPU 配置。
  • Dynamo Snapshot 是 NVIDIA Dynamo 框架的一部分,該框架是一個開源、高吞吐量、低延遲的推論框架,旨在管理多節點分散式環境中的生成式 AI 和推理模型。

🛠️ 技術深入

  • 核心機制:結合 CRIU(Checkpoint/Restore in User-space)來序列化主機狀態(CPU 記憶體、執行緒、檔案描述符、命名空間等),以及 NVIDIA 的 cuda-checkpoint 工具來序列化設備狀態(CUDA 上下文、串流、設備記憶體、虛擬位址映射等)。
  • 工作流程:首先啟動一個工作器並對其初始化狀態進行檢查點,將檢查點儲存在命名空間本地的快照卷上,然後後續的工作器可以從該檢查點恢復,而非重新冷啟動。
  • 主要組件
    • Snapshot Agent:一個基於 Go 語言的 DaemonSet 二進位檔,負責協調 CRIU 傾印和 cuda-checkpoint 工作流程,並將檢查點 tar 檔案寫入共享儲存。它透過 Kubernetes 標籤監控檢查點來源和恢復目標 Pod。
    • nsrestore:一個輔助二進位檔,在佔位符容器內透過 nsenter 執行,用於應用 rootfs 疊加並執行 CRIU 和 CUDA 恢復操作。
    • 佔位符映像:啟用快照的工作器必須使用一個佔位符映像,該映像將正常的運行時映像與恢復工具(CRIU、cuda-checkpointnsrestore)打包在一起。
    • DynamoCheckpoint CRD:透過 Kubernetes 自訂資源 (Custom Resources) 和 Pod 標籤與 Dynamo Operator 整合,實現自動化的檢查點生命週期管理。
  • 先決條件:需要 x86_64 (amd64) GPU 節點、NVIDIA 驅動程式 580.xx 或更新版本、用於跨節點恢復的 ReadWriteMany 儲存,以及執行特權 DaemonSet 以進行 CRIU 操作的安全許可。
  • 目前限制:作為實驗性功能,目前處於預覽階段。主要支援 LLM 解碼和預填充工作器(vLLM、SGLang),不支援專用工作器(多模態、嵌入、擴散)。目前僅限於單 GPU 配置(多 GPU 尚未正式支援)。活動的 TCP 連接無法進行檢查點。僅支援 x86_64 (AMD64) 架構。

🔮 前景展望AI analysis grounded in cited sources

降低 AI 推論的營運成本
透過顯著縮短冷啟動時間,Dynamo Snapshot 使得在需求較低時更積極地縮減至零或接近零成為可能,從而提高 GPU 利用率並降低基礎設施開支。
增強生成式 AI 應用程式的響應能力
更快的啟動速度使 AI 服務(特別是那些需求波動的聊天機器人或代理式 AI)能夠迅速擴展,滿足使用者請求而不會出現明顯延遲,從而改善使用者體驗。
推動 GPU 工作負載動態擴展的更廣泛採用
克服冷啟動障礙使得動態擴展策略對於 Kubernetes 上更廣泛的 GPU 密集型應用程式(不僅限於 LLM)更具可行性和吸引力。

時間線

2018-11
NVIDIA TensorRT Inference Server(後來的 Triton)發布,專注於通用推論優化和容器化微服務。
2025-05
NVIDIA 推出 Dynamo,一個用於擴展推理 AI 模型的低延遲分散式推論框架。
2025-06
NVIDIA Triton Inference Server 整合到 Dynamo 平台並更名為 NVIDIA Dynamo-Triton。
2026-01
NVIDIA Dynamo Snapshot 文件發布,標誌著其實驗性預覽版本的推出。
2026-03
NVIDIA Dynamo 1.0 正式發布,作為一個用於 AI 推論工作負載的生產級開源分散式作業系統。
2026-05
NVIDIA Dynamo Snapshot Agent 容器在 NGC Catalog 上線,仍標記為實驗性預覽功能。

📎 來源 (16)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. nvidia.com
  2. nvidia.com
  3. nvidia.com
  4. nvidia.com
  5. nvidia.com
  6. nvidia.com
  7. scaleops.com
  8. bentoml.com
  9. nvidia.com
  10. vexxhost.com
  11. nvidia.com
  12. nvidia.com
  13. medium.com
  14. nvidia.com
  15. nvidia.com
  16. mlq.ai
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog