🧠机器之心•較早收集於 3h
DeepSeek DualPath 智能體 LLM 推理加速 1.9 倍

💡智能體 LLM 吞吐量 1.9 倍提升,KV-Cache 頻寬資源池化(38字)
⚡ 30-Second TL;DR
有什麼變化
針對「長上下文、短追加」智能體 LLM 工作負載推出 DualPath
為什麼重要
DualPath 打破單節點 I/O 限制,提升多輪智能體部署可擴展性,有望降低生產環境 AI 智能體推理成本。
下一步行動
從 arXiv 下載 DualPath 論文,在你的 LLM 服務叢集中原型化雙路徑 KV-Cache 載入機制。
誰應關注:Researchers & Academics
關鍵要點
- •針對「長上下文、短追加」智能體 LLM 工作負載推出 DualPath
- •透過 Storage-to-Decode 路徑與 RDMA 傳輸解決 KV-Cache 讀取負載不均
- •離線吞吐量提升 1.87 倍,在線服務提升 1.96 倍
- •將叢集所有儲存網卡聚合為全球資源池
- •論文 arXiv:https://arxiv.org/pdf/2602.21548
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •DualPath 在 DeepSeek 660B 生產級模型上實現離線推理吞吐量提升 1.87 倍,並顯著優化高負載下的 Time To First Token (TTFT),同時 Token-to-Token 生成速度幾乎不受影響。
- •實驗涵蓋 DeepSeek-V3、DeepSeek 27B、DeepSeek 660B 及 Qwen 32B 模型,在 1P1D、2P1D、1P2D 等預填充-解碼比例下,平均加速達 1.64 倍,最高達 2.46 倍。
- •DualPath 每個節點為 DeepSeek 模型分配 80GB DRAM,而 SGL(MC) 則使用 1.5TB DRAM,證明其在不增加硬體成本下有效消除 KV-cache I/O 瓶頸。
🛠️ 技術深入
- •DualPath 建置於現代推理堆疊之上,利用 Storage-to-Decode 路徑與 RDMA 傳輸,聚合叢集儲存網卡為全球資源池,實現適應性排程與嚴格流量隔離。
- •在 DeepSeek 660B 上相對於 Baseline 實現最高 1.87 倍加速,接近 Oracle 性能,表示 KV-cache I/O 幾乎被消除;在 DeepSeek 27B 上提升 1.78 倍,但受限於 1P1D 儲存頻寬。
- •評估使用具長上下文與高快取重用之代理工作負載,涵蓋離線 Rollout 與線上服務情境,維持 Token-between Latency 穩定。
🔮 前景展望AI analysis grounded in cited sources
DualPath 將成為代理 LLM 推理系統標準優化框架
其證明透過重新設計資料載入路徑即可打破 I/O 牆,利用閒置解碼引擎頻寬提升近 2 倍吞吐,無需額外硬體。
將加速 DeepSeek V4 等後續模型之部署效率
論文聚焦長上下文代理工作負載,正符合 V4 強調之長上下文編碼與工程工作流程需求,提升生產環境吞吐與延遲穩定性。
⏳ 時間線
2026-02
DeepSeek 與清華、北大發表 DualPath 論文於 arXiv
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- eu.36kr.com — 3700922638053255
- arXiv — 2602
- vertu.com — Open Source LLM Leaderboard 2026 Rankings Benchmarks the Best Models Right Now
- introl.com — Deepseek V4 February 2026 Coding Model Release
- futureagi.substack.com — Top 11 LLM API Providers in 2026
- atlascloud.ai — Deepseek V4 Expect in 2026
- llm-stats.com — Benchmarks
- magazine.sebastianraschka.com — State of Llms 2025
- onyx.app — LLM Leaderboard
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 机器之心 ↗
每週 AI 簡報
每週一封,可隨時退訂。