
Context:主動式目標導向智慧架構
Context 是 Magarshak Architecture 的新型智慧層,將 AI 從被動式聊天機器人轉變為具備主動目標導向的代理。它利用沙盒程式與結構化互動,在無需持續使用者提示的情況下自主推進任務。
Tag: #kv-cache63 results

Context 是 Magarshak Architecture 的新型智慧層,將 AI 從被動式聊天機器人轉變為具備主動目標導向的代理。它利用沙盒程式與結構化互動,在無需持續使用者提示的情況下自主推進任務。

一項評估 TurboQuant 變體的報告顯示,標準 FP8 仍然是 KV-cache 量化的最佳選擇。如 k3v4-nc 等低位元變體在長上下文任務中表現出顯著的準確度下降。
Together AI 探討伺服 DeepSeek-V4,將百萬 token 上下文視為推理系統難題。他們詳述在 NVIDIA HGX B200 上的優化,包括壓縮 KV 佈局、前綴快取、核心成熟度,以及長上下文工作負載的端點配置。

Apple 提出隨機 KV 路由,實現 transformer 模型的自適應深度快取共享,降低高吞吐量服務的 KV 快取記憶體。該方法針對深度維度進行優化,與時間軸壓縮方法正交。先前研究顯示每層完整快取多餘。

AI加速瓶頸為記憶體頻寬、資料移動與MoE等不規則運算,而非純計算。大語言模型推論KV快取讀取主宰解碼階段,閒置計算單元。GPU至TPU硬體面臨能量、延遲、面積權衡,推動新架構。
獨立創辦人推出 Spiral,使用 INT3 模型壓縮(+0.14 nats)和 2-bit KV 快取,搭配 Apple M 系列的自訂融合 Metal 核心。Qwen 7B 預覽版可透過 brew 安裝。未來將支援 Triton GPU 核心並推出更多 100B 以下模型。
單 GPU 開源重現 Cartridges(語料特定 KV 壓縮)與 STILL(可重用神經壓縮)。包含與全上下文、截斷及 Cartridges 的基準測試。可讀代碼適用長上下文推理與 KV 快取系統權衡。

Moonshot AI的Kimi團隊發布新論文,創新KVCache,將其轉化為新型商業模式。此突破被定位為超長上下文處理的福音。此方法承諾在延長推理場景中帶來效率提升。
KIV 以分層系統取代 HuggingFace KV 快取,在 RTX 4070(12GB VRAM)實現 1M 權杖上下文。最近權杖留於 VRAM,舊 K/V 移至 RAM;每步經 K 索引擷取前 ~256 相關 V。DynamicCache 模型即插即用,無需重訓。
TurboQuant Pro 是一個開源工具包,可將高維向量壓縮 5-42 倍,同時保留 0.95+ 餘弦相似度。它在 240 萬個真實 BGE-M3 嵌入向量上基準測試 6 種方法,並與 pgvector/FAISS 整合。MIT 授權,透過 pip 安裝,用於 RAG、KV 快取和向量資料庫。