
DeepSeek V4 預覽版:三大重要原因
中國 AI 公司 DeepSeek 於週五發布其期待已久的旗艦模型 V4 預覽版。此模型能處理比前代更長的提示,歸功於新設計提升大量文字處理效率。V4 延續前代開放原始碼特性。
Tag: #long-context85 results

中國 AI 公司 DeepSeek 於週五發布其期待已久的旗艦模型 V4 預覽版。此模型能處理比前代更長的提示,歸功於新設計提升大量文字處理效率。V4 延續前代開放原始碼特性。

Moonshot AI 在 Kimi Chat 和 API 上推出 Kimi K2.6。此更新引入長上下文編碼和代理執行支持。針對開發者和 Kimi Chat 使用者,提升生產力。
單 GPU 開源重現 Cartridges(語料特定 KV 壓縮)與 STILL(可重用神經壓縮)。包含與全上下文、截斷及 Cartridges 的基準測試。可讀代碼適用長上下文推理與 KV 快取系統權衡。

Moonshot AI的Kimi團隊發布新論文,創新KVCache,將其轉化為新型商業模式。此突破被定位為超長上下文處理的福音。此方法承諾在延長推理場景中帶來效率提升。

新型AI記憶解決方案解決短期回憶問題。從Claude-Mem到DeepSeek DSA的發展。LLM擺脫金魚般記憶限制。
KIV 以分層系統取代 HuggingFace KV 快取,在 RTX 4070(12GB VRAM)實現 1M 權杖上下文。最近權杖留於 VRAM,舊 K/V 移至 RAM;每步經 K 索引擷取前 ~256 相關 V。DynamicCache 模型即插即用,無需重訓。

使用者測試顯示 Gemma 4 26B A4B 使用 llama.cpp 和 Unsloth GGUF,在 262k 上下文的 94% 維持連貫性。它能準確處理如除錯 NVIDIA SMI 腳本的複雜任務。高上下文優化設定防止循環。
開發者 peva3 在 llama.cpp 中加入 Turboquant、Heavy-Hitter Oracle (H2O) 和 StreamingLLM,大幅提升效能。在 16GB 4060ti GPU 上,使用 Qwen 3.5 4B 模型可達 256k+ 上下文的全速生成。CPU 和 CUDA 版本已完整可用,GitHub 上有詳細文件。
系統性審計發現 LoCoMo 的 1,540 題答案金鑰有 6.4% 錯誤,包括幻覺事實與時間推論失誤,完美系統理論最高分僅 93.6%。gpt-4o-mini 評審接受 62.81% 故意錯誤答案,特別是模糊回應。LongMemEval-S 因資料集小而非真正記憶測試。

IndexCache 是清華大學與 Z.ai 開發的稀疏注意力優化器,可減少 DSA 模型高達 75% 的冗餘計算,在 200k 令牌上實現 1.82 倍更快的首 token 時間及 1.48 倍更快的生成吞吐量。它針對 DeepSeek Sparse Attention 架構,適用於 DeepSeek 和 GLM 系列模型。初步測試證實其在 744B 參數的 GLM-5 模型上有效。