🦙較早收集於 71m

vLLM 動態專家快取支援低 VRAM MoE

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡在 8GB VRAM 運行 16G MoE 模型 – vLLM PR 革新記憶體使用!

⚡ 30-Second TL;DR

有什麼變化

LRU 快取:活躍專家在 VRAM,其他在 RAM,讓 16G MoE 跑在 8G VRAM

為什麼重要

大幅降低 MoE 推論的 VRAM 門檻,讓消費級 GPU 也能部署,並擴大對大型模型的存取權。

下一步行動

測試 vLLM PR #37190,在 8GB VRAM 環境運行你的 MoE 模型。

誰應關注:Developers & AI Engineers

關鍵要點

  • LRU 快取:活躍專家在 VRAM,其他在 RAM,讓 16G MoE 跑在 8G VRAM
  • 快取遺漏處理:專家重排時用 CPU 計算以降低延遲
  • 目前支援 fp8/bf16;未來 mxfp4 量化、磁碟串流、二層快取
  • 已測試 PR 待審:https://github.com/vllm-project/vllm/pull/37190

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • vLLM支援分散式專家分片,將專家分散至多GPU與節點,擴展數百專家模型超出單裝置記憶體限制。
  • 專家存取呈現高度偏態與時間局部性,熱門專家頻繁激活,其他閒置,導致靜態放置策略效能退化。
  • vLLM整合Expert Parallelism與Data Parallel Attention,適用於MLA+MoE模型如DeepSeek V3,提升記憶體效率與吞吐量。

🛠️ 技術深入

  • 動態專家路由將每個token僅送至指定專家,降低相較密集模型的計算開銷,並使用Expert parallel load balancing動態複製或重分熱門專家。
  • 專家駐留映射追蹤每個專家位置(本地HBM、對等HBM或主機DRAM),快取遺漏時優先檢查對等GPU記憶體。
  • 支援FP8 KV快取量化,使用per-tensor縮放因子,減少記憶體佔用達兩倍,提升吞吐量但目前無延遲改善。

🔮 前景展望AI analysis grounded in cited sources

vLLM動態專家快取將使消費者級硬體廣泛部署大型MoE模型
透過LRU政策與RAM/CPU後備,將16G模型壓縮至8G VRAM,降低部署門檻並擴大MoE應用範圍。
結合mxfp4量化與磁碟串流後,vLLM將支援超長上下文MoE推理
未來功能將進一步壓縮記憶體並擴展至儲存層,解決長序列記憶體爆炸問題。

時間線

2024-01
vLLM初始發布,引入PagedAttention與持續批次處理
2025-02
新增FP8 KV快取量化支援,提升記憶體效率
2026-01
發布vLLM v0.15.1,支援PyTorch 2.10與RTX Blackwell
2026-02
Q1 Roadmap公布,聚焦KV快取管理器與分散式執行
2026-03
PR #37190提交,引入動態專家快取LRU政策
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。