🦙Reddit r/LocalLLaMA•較早收集於 71m
vLLM 動態專家快取支援低 VRAM MoE
💡在 8GB VRAM 運行 16G MoE 模型 – vLLM PR 革新記憶體使用!
⚡ 30-Second TL;DR
有什麼變化
LRU 快取:活躍專家在 VRAM,其他在 RAM,讓 16G MoE 跑在 8G VRAM
為什麼重要
大幅降低 MoE 推論的 VRAM 門檻,讓消費級 GPU 也能部署,並擴大對大型模型的存取權。
下一步行動
測試 vLLM PR #37190,在 8GB VRAM 環境運行你的 MoE 模型。
誰應關注:Developers & AI Engineers
關鍵要點
- •LRU 快取:活躍專家在 VRAM,其他在 RAM,讓 16G MoE 跑在 8G VRAM
- •快取遺漏處理:專家重排時用 CPU 計算以降低延遲
- •目前支援 fp8/bf16;未來 mxfp4 量化、磁碟串流、二層快取
- •已測試 PR 待審:https://github.com/vllm-project/vllm/pull/37190
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •vLLM支援分散式專家分片,將專家分散至多GPU與節點,擴展數百專家模型超出單裝置記憶體限制。
- •專家存取呈現高度偏態與時間局部性,熱門專家頻繁激活,其他閒置,導致靜態放置策略效能退化。
- •vLLM整合Expert Parallelism與Data Parallel Attention,適用於MLA+MoE模型如DeepSeek V3,提升記憶體效率與吞吐量。
🛠️ 技術深入
- •動態專家路由將每個token僅送至指定專家,降低相較密集模型的計算開銷,並使用Expert parallel load balancing動態複製或重分熱門專家。
- •專家駐留映射追蹤每個專家位置(本地HBM、對等HBM或主機DRAM),快取遺漏時優先檢查對等GPU記憶體。
- •支援FP8 KV快取量化,使用per-tensor縮放因子,減少記憶體佔用達兩倍,提升吞吐量但目前無延遲改善。
🔮 前景展望AI analysis grounded in cited sources
vLLM動態專家快取將使消費者級硬體廣泛部署大型MoE模型
透過LRU政策與RAM/CPU後備,將16G模型壓縮至8G VRAM,降低部署門檻並擴大MoE應用範圍。
結合mxfp4量化與磁碟串流後,vLLM將支援超長上下文MoE推理
未來功能將進一步壓縮記憶體並擴展至儲存層,解決長序列記憶體爆炸問題。
⏳ 時間線
2024-01
vLLM初始發布,引入PagedAttention與持續批次處理
2025-02
新增FP8 KV快取量化支援,提升記憶體效率
2026-01
發布vLLM v0.15.1,支援PyTorch 2.10與RTX Blackwell
2026-02
Q1 Roadmap公布,聚焦KV快取管理器與分散式執行
2026-03
PR #37190提交,引入動態專家快取LRU政策
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
