🤝較早收集於 39h

CPD:長上下文 LLM 服務加速 40%

PostLinkedIn
🤝閱讀原文: Together AI Blog
#llm-inference#long-context#cache-optimizationtogether-ai-cpdtogether-aicpd

💡CPD 實現長上下文 LLM 服務加速 40%—生產推理擴展必備。(38字)

⚡ 30-Second TL;DR

有什麼變化

推出 CPD 架構實現 LLM 推理分離

為什麼重要

CPD 實現長上下文 LLM 的可擴展生產服務,降低延遲與成本,適用真實應用。AI 開發者處理完整文件或對話等長輸入更高效。

下一步行動

使用您的長上下文 LLM 提示測試 Together AI 的 CPD 服務端點,體驗 40% 吞吐量提升。

誰應關注:Developers & AI Engineers

關鍵要點

  • 推出 CPD 架構實現 LLM 推理分離
  • 分離快取溫熱預填充與冷解碼階段
  • 長上下文服務吞吐量提升 40%
  • 大幅降低長提示首 token 時間

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

🔑 增強重點摘要

  • CPD 採用三層 KV-cache 階層,包括 GPU 記憶體、host DRAM 及透過 RDMA 連接的叢集式分散快取,提升冷請求後續溫熱請求的處理速度。[3]
  • CPD 在 NVIDIA B200 GPU 上測試,使用合成程式碼代理工作負載,於混合溫冷負載下維持低於一秒的首 token 時間 (TTFT)。[1][3]
  • CPD 在增加解碼容量 (1D 至 2D) 時,仍持續提供較高每 GPU QPS,並延緩系統飽和。[3]

🛠️ 技術深入

  • CPD 架構分為三種節點類型:pre-prefill 節點處理冷請求 (無可重用上下文),標準 prefill 節點處理溫熱請求 (從快取拉取 KV 狀態),解碼節點專注 token 生成。[1]
  • 三層 KV-cache 階層:GPU 記憶體為最快層,後接 host DRAM,及分散式快取;冷請求 KV 狀態寫入分散快取,後續請求以高頻寬批量擷取,轉換數秒計算為數百毫秒傳輸。[3]
  • 測試於 600 秒穩態,使用合成程式碼代理工作負載模擬真實 AI 輔助開發情境,包含大型共享程式碼庫與多輪互動。[1]

🔮 前景展望AI analysis grounded in cited sources

CPD 將重塑長上下文 AI 應用如程式碼副駕駛及檢索增強系統的經濟性
透過 35-40% 吞吐量提升及低延遲,降低長提示超過 100k token 的運算瓶頸,使 AI 原生應用更具成本效益。[1]
CPD 優化將擴展至 Together AI 其他推理技術如推測解碼與 FP4 量化
Together AI 已展示多項推理加速創新,CPD 的快取分離可與既有優化結合,提升整體平台效能。[2][7]

時間線

2026-02
Together AI 發佈 CPD 架構部落格文章,介紹快取感知預填充-解碼分離技術
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Together AI Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。