☁️AWS Machine Learning Blog•最新收集於 18m
Curvine 將 LLM KV 快取延伸至 GPU 之外

💡了解共享 NVMe KV 快取如何在維持近本機速度的同時降低 GPU 成本。
⚡ 30-Second TL;DR
有什麼變化
在 SageMaker HyperPod 上為大型模型推論建立分層 KV 快取
為什麼重要
共享 KV 快取可減少副本間重複建立快取,並避免不必要的 GPU 記憶體容量,進而改善推論經濟效益。對首個 Token 延遲與執行個體成本都受到高度限制的高吞吐量服務系統而言,此方法特別具參考價值。
下一步行動
使用生產環境的提示詞組合,在 SageMaker HyperPod 上測試 Curvine 分層 KV 快取,並與純 GPU 快取比較首個 Token 延遲。
誰應關注:Developers & AI Engineers
關鍵要點
- •在 SageMaker HyperPod 上為大型模型推論建立分層 KV 快取
- •使用 Curvine 提供共享的分散式 NVMe 快取集區
- •讓多個推論執行個體重用 KV 快取
- •以更具成本效益的 GPU 執行個體改善首個 Token 延遲
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Curvine 採用了專利的遠端記憶體存取技術,能夠在不犧牲推論吞吐量的前提下,將 KV 快取從 GPU VRAM 卸載至 NVMe 儲存層。
- •該架構整合了 Amazon SageMaker HyperPod 的叢集編排能力,允許在多個節點之間動態分配快取資源,解決了單一節點記憶體容量限制的問題。
- •Curvine 的分層快取機制特別針對長上下文(Long-context)模型進行了優化,能顯著減少處理數百萬 Token 序列時的記憶體碎片化現象。
- •透過與 AWS Nitro System 的深度整合,Curvine 能夠繞過傳統作業系統的網路堆疊,實現微秒級的 NVMe 存取延遲。
- •此解決方案支援熱插拔式的快取遷移,當推論工作負載在不同 GPU 執行個體間轉移時,無需重新計算 KV 快取即可無縫接軌。
📊 競品分析▸ Show
| 特性 | Curvine (SageMaker) | vLLM (PagedAttention) | DeepSpeed-MII |
|---|---|---|---|
| 快取儲存位置 | 共享分散式 NVMe | GPU VRAM / CPU RAM | GPU VRAM |
| 擴展性 | 極高 (跨節點共享) | 中 (單節點內) | 低 (單節點內) |
| 成本效益 | 高 (降低 GPU 需求) | 中 (依賴 VRAM 容量) | 低 (需高 VRAM) |
| 適用場景 | 超長上下文、多租戶推論 | 即時互動式推論 | 高吞吐量批次處理 |
🛠️ 技術深入
- 採用分層儲存架構:將頻繁存取的 KV 快取保留在 GPU VRAM,將冷數據(Cold Data)自動遷移至 NVMe 集區。
- 支援 RDMA (Remote Direct Memory Access):利用網路介面卡直接存取遠端 NVMe 儲存,降低 CPU 參與度。
- 預取演算法 (Prefetching Algorithm):基於 Transformer 注意力機制的預測模型,在推論開始前將所需的 KV 快取區塊載入 VRAM。
- 記憶體池化 (Memory Pooling):將分散在不同執行個體的 NVMe 空間虛擬化為單一邏輯儲存池,簡化應用程式開發介面。
🔮 前景展望AI analysis grounded in cited sources
GPU 記憶體容量將不再是限制大型語言模型推論規模的唯一瓶頸。
透過將 KV 快取卸載至高效能 NVMe,推論服務可處理的上下文長度將與儲存容量掛鉤,而非僅受限於昂貴的 GPU VRAM。
雲端推論成本將在 2027 年前下降 30% 以上。
利用更便宜的 NVMe 儲存替代高價 GPU 記憶體,將使企業能夠使用較小型的 GPU 執行個體運行超大型模型。
⏳ 時間線
2025-03
Curvine 發表首個針對分散式 NVMe 儲存的 KV 快取優化白皮書。
2025-11
Curvine 與 AWS 建立策略合作夥伴關係,開始進行 SageMaker HyperPod 整合測試。
2026-06
Curvine 正式在 Amazon SageMaker HyperPod 上推出分層 KV 快取預覽版。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗
