🍎Apple Machine Learning•較早收集於 20h
Apple 隨機 KV 路由降低快取記憶體

💡Apple 深度 KV 共享大幅降低 LLM 服務記憶體—對可擴展推理至關重要。(48字)
⚡ 30-Second TL;DR
有什麼變化
提出隨機 KV 路由實現自適應深度 KV 共享
為什麼重要
此創新可大幅降低 LLM 服務成本,減少 KV 快取需求,讓資源受限硬體更有效部署。它提供現有方法的強健替代,提升生產 AI 系統吞吐量。
下一步行動
閱讀 Apple ML 完整論文,並在 vLLM 中原型化深度 KV 共享。
誰應關注:Researchers & Academics
關鍵要點
- •提出隨機 KV 路由實現自適應深度 KV 共享
- •降低自迴歸 transformer 生成的記憶體佔用
- •優化深度維度,補充時間軸驅逐技術
- •解決每層完整快取的冗餘問題
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •隨機 KV 路由(Randomized KV Routing)透過在推理過程中動態選擇層級來共享 KV 快取,顯著減少了模型在處理長序列時的記憶體佔用,而不影響生成品質。
- •該技術利用了 Transformer 模型中層級間的冗餘性,透過隨機化機制避免了傳統固定層級共享可能導致的資訊瓶頸或特定層級過載問題。
- •此方法與現有的 KV 快取壓縮技術(如 Grouped-Query Attention 或層級剪枝)具有高度相容性,可作為一種正交的優化手段部署在現有的推理引擎中。
🛠️ 技術深入
• 核心機制:在推理階段,針對每個 Token 或 Token 區塊,隨機分配其 KV 狀態至預定義的層級子集,而非儲存所有層級的完整 KV 狀態。 • 深度維度優化:該方法專注於 Transformer 的深度(層數)維度,透過隨機路由策略實現自適應的深度共享,有效降低了記憶體頻寬需求。 • 與時間軸壓縮的關係:與傳統針對序列長度(時間軸)進行壓縮(如 PagedAttention 或 KV 快取驅逐)的方法不同,隨機 KV 路由在層級維度上進行稀疏化,兩者可疊加使用以達到更佳的壓縮比。
🔮 前景展望AI analysis grounded in cited sources
隨機 KV 路由將成為邊緣裝置部署大型語言模型的標準配置。
該技術能顯著降低記憶體需求,使記憶體受限的邊緣裝置(如 iPhone 或 Mac)能夠運行更大規模的 Transformer 模型。
此技術將推動推理引擎架構從靜態記憶體分配轉向動態路由分配。
隨機路由的引入要求推理引擎具備更靈活的記憶體管理機制,以處理動態變化的 KV 快取路徑。
⏳ 時間線
2023-07
Apple 發布關於在裝置上運行高效能語言模型的初步研究。
2024-06
Apple 發表關於優化 Transformer 推理記憶體效率的相關技術論文。
2026-05
Apple 正式提出隨機 KV 路由技術以優化高吞吐量服務的 KV 快取。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Apple Machine Learning ↗