
IndexCache 加速長上下文推理 1.82 倍
IndexCache 是清華大學與 Z.ai 開發的稀疏注意力優化器,可減少 DSA 模型高達 75% 的冗餘計算,在 200k 令牌上實現 1.82 倍更快的首 token 時間及 1.48 倍更快的生成吞吐量。它針對 DeepSeek Sparse Attention 架構,適用於 DeepSeek 和 GLM 系列模型。初步測試證實其在 744B 參數的 GLM-5 模型上有效。
Tag: #long-context86 results

IndexCache 是清華大學與 Z.ai 開發的稀疏注意力優化器,可減少 DSA 模型高達 75% 的冗餘計算,在 200k 令牌上實現 1.82 倍更快的首 token 時間及 1.48 倍更快的生成吞吐量。它針對 DeepSeek Sparse Attention 架構,適用於 DeepSeek 和 GLM 系列模型。初步測試證實其在 744B 參數的 GLM-5 模型上有效。

隨著 LLM 上下文窗口擴大,效能意外下降。「分而治之」框架透過規劃器、工作者和管理者將長文件分解為並行區塊。小模型如 Llama-3-70B 和 Qwen-72B 在單次處理中超越 GPT-4o。

MiMo-V2-Pro 是 MiMo-V2-Flash(309B 總參數/15B 活躍)的重大升級,在 Intelligence Index 上得分更高。具備 1M 權杖上下文視窗,目前僅透過小米 API 提供。定價從每 1M 輸入/輸出權杖 $1/$3 起。
使用 SGLang 在 RTX Pro 6000 上對 Mistral-Small-4-119B-2603 NVFP4 進行詳細基準測試,1K 上下文單使用者達 131 tok/s,256K 降至 64 tok/s。TTFT 隨上下文和並發增加急劇上升,限制長上下文任務容量。無快取下短聊天機器人最高並發達 19 使用者。
開發者推出 State Flow Machine (SFM),捨棄 Transformer 以明確狀態轉換處理程式碼/推理。首項實驗長度保留率達 79%,遠勝 Transformer 的 2%。從 FlashLM 的 SlotMemoryAttention 進化為動態 DeltaNet 槽位銀行。

Anthropic 正式全面開放 Claude Opus 4.6 和 Sonnet 4.6 的 100 萬 token 上下文窗口,並以標準價格計費,不再收取長上下文溢價。Opus 4.6 輸入每百萬 token 5 美元、輸出 25 美元;Sonnet 4.6 輸入 3 美元、輸出 15 美元。即使是 90 萬 token 的請求,單位 token 費用也與 9000 token 請求相同。

NVIDIA Nemotron 3 Super 現已在 Together AI 的 Dedicated Inference 平台上提供。該模型具備高效的多代理推理能力,並支援 1M 令牌上下文視窗。它可在全託管基礎設施上實現生產級部署。
Hugging Face 推出 Ulysses 序列並行技術,用於百萬 Token 上下文的模型訓練。它克服長序列訓練的記憶體瓶頸。對推進大型上下文 LLM 至關重要。

MIT 研究人員開發 Attention Matching,這是一種快速 KV 快取壓縮技術,可將 LLM 記憶體使用量減少高達 50 倍,幾乎無準確度損失。它解決了長上下文企業 AI 應用(如法律分析和多會話對話)的記憶體瓶頸。此方法在保留資訊方面優於驅逐、合併和摘要技術。
OpenAI 準備推出 GPT-5.4,上下文視窗超過 100 萬 tokens,超越 GPT-5.2 的 40 萬限制。它在長時間複雜任務中表現更佳,錯誤率降低,並引入「極限推理」模式以解決更深層問題。此舉追趕 Google 與 Anthropic 的大型上下文模型。