☁️最新收集於 18m

Curvine 將 LLM KV 快取延伸至 GPU 之外

Curvine 將 LLM KV 快取延伸至 GPU 之外
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog

💡了解共享 NVMe KV 快取如何在維持近本機速度的同時降低 GPU 成本。

⚡ 30-Second TL;DR

有什麼變化

在 SageMaker HyperPod 上為大型模型推論建立分層 KV 快取

為什麼重要

共享 KV 快取可減少副本間重複建立快取,並避免不必要的 GPU 記憶體容量,進而改善推論經濟效益。對首個 Token 延遲與執行個體成本都受到高度限制的高吞吐量服務系統而言,此方法特別具參考價值。

下一步行動

使用生產環境的提示詞組合,在 SageMaker HyperPod 上測試 Curvine 分層 KV 快取,並與純 GPU 快取比較首個 Token 延遲。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在 SageMaker HyperPod 上為大型模型推論建立分層 KV 快取
  • 使用 Curvine 提供共享的分散式 NVMe 快取集區
  • 讓多個推論執行個體重用 KV 快取
  • 以更具成本效益的 GPU 執行個體改善首個 Token 延遲

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Curvine 採用了專利的遠端記憶體存取技術,能夠在不犧牲推論吞吐量的前提下,將 KV 快取從 GPU VRAM 卸載至 NVMe 儲存層。
  • 該架構整合了 Amazon SageMaker HyperPod 的叢集編排能力,允許在多個節點之間動態分配快取資源,解決了單一節點記憶體容量限制的問題。
  • Curvine 的分層快取機制特別針對長上下文(Long-context)模型進行了優化,能顯著減少處理數百萬 Token 序列時的記憶體碎片化現象。
  • 透過與 AWS Nitro System 的深度整合,Curvine 能夠繞過傳統作業系統的網路堆疊,實現微秒級的 NVMe 存取延遲。
  • 此解決方案支援熱插拔式的快取遷移,當推論工作負載在不同 GPU 執行個體間轉移時,無需重新計算 KV 快取即可無縫接軌。
📊 競品分析▸ Show
特性Curvine (SageMaker)vLLM (PagedAttention)DeepSpeed-MII
快取儲存位置共享分散式 NVMeGPU VRAM / CPU RAMGPU VRAM
擴展性極高 (跨節點共享)中 (單節點內)低 (單節點內)
成本效益高 (降低 GPU 需求)中 (依賴 VRAM 容量)低 (需高 VRAM)
適用場景超長上下文、多租戶推論即時互動式推論高吞吐量批次處理

🛠️ 技術深入

  • 採用分層儲存架構:將頻繁存取的 KV 快取保留在 GPU VRAM,將冷數據(Cold Data)自動遷移至 NVMe 集區。
  • 支援 RDMA (Remote Direct Memory Access):利用網路介面卡直接存取遠端 NVMe 儲存,降低 CPU 參與度。
  • 預取演算法 (Prefetching Algorithm):基於 Transformer 注意力機制的預測模型,在推論開始前將所需的 KV 快取區塊載入 VRAM。
  • 記憶體池化 (Memory Pooling):將分散在不同執行個體的 NVMe 空間虛擬化為單一邏輯儲存池,簡化應用程式開發介面。

🔮 前景展望AI analysis grounded in cited sources

GPU 記憶體容量將不再是限制大型語言模型推論規模的唯一瓶頸。
透過將 KV 快取卸載至高效能 NVMe,推論服務可處理的上下文長度將與儲存容量掛鉤,而非僅受限於昂貴的 GPU VRAM。
雲端推論成本將在 2027 年前下降 30% 以上。
利用更便宜的 NVMe 儲存替代高價 GPU 記憶體,將使企業能夠使用較小型的 GPU 執行個體運行超大型模型。

時間線

2025-03
Curvine 發表首個針對分散式 NVMe 儲存的 KV 快取優化白皮書。
2025-11
Curvine 與 AWS 建立策略合作夥伴關係,開始進行 SageMaker HyperPod 整合測試。
2026-06
Curvine 正式在 Amazon SageMaker HyperPod 上推出分層 KV 快取預覽版。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog