📄ArXiv AI•最新收集於 17h
Minima-KV 壓縮長上下文 KV 快取

#kv-cache#long-context#paged-attention#quantizationminima-kvminima-kvqwen3.6-27bnvidia
💡了解混合 FP8/TQ3 KV 頁面如何在不驅逐活躍請求狀態下,實現相較 BF16 的 3.5 倍壓縮。
⚡ 30-Second TL;DR
有什麼變化
混合格式 paged attention 讓每個執行中請求的頁面都可定址,無須驅逐活躍 KV 狀態。
為什麼重要
若能在更多模型與工作負載中獲得驗證,Minima-KV 可望在受記憶體限制的 GPU 上大幅提升長上下文服務容量,同時保留活躍請求狀態。其混合格式執行也可能降低對激進上下文驅逐或大型 dense 快取副本的需求。
下一步行動
在最長上下文的 Qwen3.6-27B 服務工作負載上建立 Minima-KV 原型,並與 BF16 和 FP8 基線比較每 token 記憶體用量、LongBench 類型品質及解碼吞吐量。
誰應關注:Developers & AI Engineers
關鍵要點
- •混合格式 paged attention 讓每個執行中請求的頁面都可定址,無須驅逐活躍 KV 狀態。
- •部署量測顯示每個活躍 token 的 attention KV 為 18.3 KiB,相較 BF16 壓縮 3.50 倍、相較 FP8 壓縮 1.75 倍。
- •品質設定在 16K RULER needle-in-a-haystack 測試中與 dense 控制組一致;LongBench v2 在 16K、32K 和 64K 的差異分別為 -0.80、-0.60 和 -0.40 個百分點。
- •兩個 59,008-token 請求的直接解碼 canary 達到 3.625 倍 active-KV 壓縮,吞吐量為控制組的 0.9821 倍,且不使用 dense shadow。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 10 個來源。
🔑 增強重點摘要
- •Minima-KV 採用了基於全域正規化線上 Softmax 合併(globally normalized online-softmax merge)的技術,確保在混合精度計算下維持數學上的等效性。
- •該系統專門開發了客製化的 CUDA 核心,能夠直接在 FP8 與 TQ3 混合格式上執行注意力計算,無需將過期頁面解壓縮至密集緩衝區。
- •Minima-KV 的架構設計旨在解決長上下文 LLM 推論中,KV 快取隨上下文長度、批次大小及模型參數線性增長的記憶體頻寬瓶頸。
- •在 Qwen3.6-27B 模型與 NVIDIA RTX PRO 6000 Blackwell GPU 的測試環境下,驗證了該系統在極端負載下的硬體適應性。
- •與過往採用丟棄 token 的方法不同,Minima-KV 透過分層保留機制確保所有邏輯頁面在請求生命週期內均可定址,實現了無損資訊的壓縮。
📊 競品分析▸ Show
| 特性 | Minima-KV | 傳統量化 (FP8/INT8) | 提示詞快取 (Prompt Caching) |
|---|---|---|---|
| 壓縮機制 | 分層混合格式 (FP8/TQ3) | 全域統一精度 | 預存前綴 (Prefix) |
| 資訊保留 | 保留所有頁面 (無損) | 精度損失 | 僅限特定前綴 |
| 計算開銷 | 低 (客製化 CUDA 核心) | 極低 | 無 (直接載入) |
| 適用場景 | 長上下文動態推論 | 通用推論 | 重複性提示詞場景 |
🛠️ 技術深入
- 採用三層快取架構:Recent (FP8)、Anchor (FP8)、Stale (TQ3)。
- 實作全域正規化線上 Softmax 合併,以處理不同精度格式間的注意力權重計算。
- 透過客製化 CUDA 核心實現異質格式的直接運算,避免了傳統方法中常見的解量化 (dequantization) 延遲。
- 針對 Blackwell 架構進行優化,利用其 FP8 運算能力提升吞吐量。
🔮 前景展望AI analysis grounded in cited sources
Minima-KV 將成為長上下文 LLM 推論的標準記憶體管理方案。
其在維持與密集模型幾乎一致的品質前提下,顯著降低了記憶體佔用,解決了長文本部署的經濟性問題。
混合精度 KV 快取將取代單一精度量化技術。
透過對不同重要性的 token 進行分層精度管理,能在效能與準確度之間取得比單一量化更優的帕累托最優解。
⏳ 時間線
2026-08
Minima-KV 論文正式於 ArXiv 發布,提出分層 KV 快取架構。
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。