📄最新收集於 17h

Minima-KV 壓縮長上下文 KV 快取

Minima-KV 壓縮長上下文 KV 快取
PostLinkedIn
📄閱讀原文: ArXiv AI
#kv-cache#long-context#paged-attention#quantizationminima-kvminima-kvqwen3.6-27bnvidia

💡了解混合 FP8/TQ3 KV 頁面如何在不驅逐活躍請求狀態下,實現相較 BF16 的 3.5 倍壓縮。

⚡ 30-Second TL;DR

有什麼變化

混合格式 paged attention 讓每個執行中請求的頁面都可定址,無須驅逐活躍 KV 狀態。

為什麼重要

若能在更多模型與工作負載中獲得驗證,Minima-KV 可望在受記憶體限制的 GPU 上大幅提升長上下文服務容量,同時保留活躍請求狀態。其混合格式執行也可能降低對激進上下文驅逐或大型 dense 快取副本的需求。

下一步行動

在最長上下文的 Qwen3.6-27B 服務工作負載上建立 Minima-KV 原型,並與 BF16 和 FP8 基線比較每 token 記憶體用量、LongBench 類型品質及解碼吞吐量。

誰應關注:Developers & AI Engineers

關鍵要點

  • 混合格式 paged attention 讓每個執行中請求的頁面都可定址,無須驅逐活躍 KV 狀態。
  • 部署量測顯示每個活躍 token 的 attention KV 為 18.3 KiB,相較 BF16 壓縮 3.50 倍、相較 FP8 壓縮 1.75 倍。
  • 品質設定在 16K RULER needle-in-a-haystack 測試中與 dense 控制組一致;LongBench v2 在 16K、32K 和 64K 的差異分別為 -0.80、-0.60 和 -0.40 個百分點。
  • 兩個 59,008-token 請求的直接解碼 canary 達到 3.625 倍 active-KV 壓縮,吞吐量為控制組的 0.9821 倍,且不使用 dense shadow。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

🔑 增強重點摘要

  • Minima-KV 採用了基於全域正規化線上 Softmax 合併(globally normalized online-softmax merge)的技術,確保在混合精度計算下維持數學上的等效性。
  • 該系統專門開發了客製化的 CUDA 核心,能夠直接在 FP8 與 TQ3 混合格式上執行注意力計算,無需將過期頁面解壓縮至密集緩衝區。
  • Minima-KV 的架構設計旨在解決長上下文 LLM 推論中,KV 快取隨上下文長度、批次大小及模型參數線性增長的記憶體頻寬瓶頸。
  • 在 Qwen3.6-27B 模型與 NVIDIA RTX PRO 6000 Blackwell GPU 的測試環境下,驗證了該系統在極端負載下的硬體適應性。
  • 與過往採用丟棄 token 的方法不同,Minima-KV 透過分層保留機制確保所有邏輯頁面在請求生命週期內均可定址,實現了無損資訊的壓縮。
📊 競品分析▸ Show
特性Minima-KV傳統量化 (FP8/INT8)提示詞快取 (Prompt Caching)
壓縮機制分層混合格式 (FP8/TQ3)全域統一精度預存前綴 (Prefix)
資訊保留保留所有頁面 (無損)精度損失僅限特定前綴
計算開銷低 (客製化 CUDA 核心)極低無 (直接載入)
適用場景長上下文動態推論通用推論重複性提示詞場景

🛠️ 技術深入

  • 採用三層快取架構:Recent (FP8)、Anchor (FP8)、Stale (TQ3)。
  • 實作全域正規化線上 Softmax 合併,以處理不同精度格式間的注意力權重計算。
  • 透過客製化 CUDA 核心實現異質格式的直接運算,避免了傳統方法中常見的解量化 (dequantization) 延遲。
  • 針對 Blackwell 架構進行優化,利用其 FP8 運算能力提升吞吐量。

🔮 前景展望AI analysis grounded in cited sources

Minima-KV 將成為長上下文 LLM 推論的標準記憶體管理方案。
其在維持與密集模型幾乎一致的品質前提下,顯著降低了記憶體佔用,解決了長文本部署的經濟性問題。
混合精度 KV 快取將取代單一精度量化技術。
透過對不同重要性的 token 進行分層精度管理,能在效能與準確度之間取得比單一量化更優的帕累托最優解。

時間線

2026-08
Minima-KV 論文正式於 ArXiv 發布,提出分層 KV 快取架構。

📎 來源 (10)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. arxiv.org
  2. arxiv.org
  3. themoonlight.io
  4. arxiv.org
  5. doogree.co.il
  6. aigip.ai
  7. substack.com
  8. minimax.io
  9. claude.com
  10. arxiv.org
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。