🟩NVIDIA Developer Blog•較早收集於 20m
NVIDIA Dynamo Snapshot:加速 Kubernetes 推論工作負載啟動

💡別再讓 GPU 空轉等待冷啟動。了解如何讓您的 Kubernetes 推論副本實現即時擴展。
⚡ 30-Second TL;DR
有什麼變化
縮短 Kubernetes 上推論工作負載的冷啟動時間
為什麼重要
此功能透過在自動擴展期間將延遲降至最低,直接提升了 LLM 和推論服務的營運效率。它使基礎設施團隊能夠在不超額配置昂貴 GPU 資源的情況下維持高效能。
下一步行動
評估您目前的 Kubernetes 推論擴展延遲,並測試 NVIDIA Dynamo Snapshot 以減少冷啟動開銷。
誰應關注:Developers & AI Engineers
關鍵要點
- •縮短 Kubernetes 上推論工作負載的冷啟動時間
- •防止彈性擴展期間的 GPU 空轉
- •提升流量高峰期間的服務層級協議 (SLA) 達成率
🧠 深度解析
Web-grounded analysis with 16 cited sources.
🔑 增強重點摘要
- •NVIDIA Dynamo Snapshot 是一項實驗性功能,目前處於預覽階段,需要特定的 Kubernetes 設定並以特權 DaemonSet 模式執行,以進行 CRIU 操作。
- •此解決方案結合了 CRIU(使用者空間檢查點/恢復)來處理 CPU 端狀態,以及 NVIDIA 的 cuda-checkpoint 工具來處理 GPU 端狀態,包括 CUDA 上下文和設備記憶體。
- •Dynamo Snapshot 將大型模型在 Kubernetes 上的冷啟動時間從數分鐘大幅縮短至約 10 秒的熱啟動(從檢查點恢復)時間,顯著提升了效率。
- •目前,Dynamo Snapshot 主要支援 vLLM 和 SGLang 後端用於大型語言模型 (LLM) 工作負載,但尚未支援 TensorRT-LLM,且目前僅限於單 GPU 配置。
- •Dynamo Snapshot 是 NVIDIA Dynamo 框架的一部分,該框架是一個開源、高吞吐量、低延遲的推論框架,旨在管理多節點分散式環境中的生成式 AI 和推理模型。
🛠️ 技術深入
- 核心機制:結合 CRIU(Checkpoint/Restore in User-space)來序列化主機狀態(CPU 記憶體、執行緒、檔案描述符、命名空間等),以及 NVIDIA 的
cuda-checkpoint工具來序列化設備狀態(CUDA 上下文、串流、設備記憶體、虛擬位址映射等)。 - 工作流程:首先啟動一個工作器並對其初始化狀態進行檢查點,將檢查點儲存在命名空間本地的快照卷上,然後後續的工作器可以從該檢查點恢復,而非重新冷啟動。
- 主要組件:
- Snapshot Agent:一個基於 Go 語言的 DaemonSet 二進位檔,負責協調 CRIU 傾印和
cuda-checkpoint工作流程,並將檢查點 tar 檔案寫入共享儲存。它透過 Kubernetes 標籤監控檢查點來源和恢復目標 Pod。 nsrestore:一個輔助二進位檔,在佔位符容器內透過nsenter執行,用於應用 rootfs 疊加並執行 CRIU 和 CUDA 恢復操作。- 佔位符映像:啟用快照的工作器必須使用一個佔位符映像,該映像將正常的運行時映像與恢復工具(CRIU、
cuda-checkpoint、nsrestore)打包在一起。 - DynamoCheckpoint CRD:透過 Kubernetes 自訂資源 (Custom Resources) 和 Pod 標籤與 Dynamo Operator 整合,實現自動化的檢查點生命週期管理。
- Snapshot Agent:一個基於 Go 語言的 DaemonSet 二進位檔,負責協調 CRIU 傾印和
- 先決條件:需要 x86_64 (amd64) GPU 節點、NVIDIA 驅動程式 580.xx 或更新版本、用於跨節點恢復的 ReadWriteMany 儲存,以及執行特權 DaemonSet 以進行 CRIU 操作的安全許可。
- 目前限制:作為實驗性功能,目前處於預覽階段。主要支援 LLM 解碼和預填充工作器(vLLM、SGLang),不支援專用工作器(多模態、嵌入、擴散)。目前僅限於單 GPU 配置(多 GPU 尚未正式支援)。活動的 TCP 連接無法進行檢查點。僅支援 x86_64 (AMD64) 架構。
🔮 前景展望AI analysis grounded in cited sources
降低 AI 推論的營運成本
透過顯著縮短冷啟動時間,Dynamo Snapshot 使得在需求較低時更積極地縮減至零或接近零成為可能,從而提高 GPU 利用率並降低基礎設施開支。
增強生成式 AI 應用程式的響應能力
更快的啟動速度使 AI 服務(特別是那些需求波動的聊天機器人或代理式 AI)能夠迅速擴展,滿足使用者請求而不會出現明顯延遲,從而改善使用者體驗。
推動 GPU 工作負載動態擴展的更廣泛採用
克服冷啟動障礙使得動態擴展策略對於 Kubernetes 上更廣泛的 GPU 密集型應用程式(不僅限於 LLM)更具可行性和吸引力。
⏳ 時間線
2018-11
NVIDIA TensorRT Inference Server(後來的 Triton)發布,專注於通用推論優化和容器化微服務。
2025-05
NVIDIA 推出 Dynamo,一個用於擴展推理 AI 模型的低延遲分散式推論框架。
2025-06
NVIDIA Triton Inference Server 整合到 Dynamo 平台並更名為 NVIDIA Dynamo-Triton。
2026-01
NVIDIA Dynamo Snapshot 文件發布,標誌著其實驗性預覽版本的推出。
2026-03
NVIDIA Dynamo 1.0 正式發布,作為一個用於 AI 推論工作負載的生產級開源分散式作業系統。
2026-05
NVIDIA Dynamo Snapshot Agent 容器在 NGC Catalog 上線,仍標記為實驗性預覽功能。
📎 來源 (16)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: NVIDIA Developer Blog ↗