Search

Tag: #long-context85 results

IndexCache 加速長上下文推理 1.82 倍

IndexCache 加速長上下文推理 1.82 倍

IndexCache 是清華大學與 Z.ai 開發的稀疏注意力優化器,可減少 DSA 模型高達 75% 的冗餘計算,在 200k 令牌上實現 1.82 倍更快的首 token 時間及 1.48 倍更快的生成吞吐量。它針對 DeepSeek Sparse Attention 架構,適用於 DeepSeek 和 GLM 系列模型。初步測試證實其在 744B 參數的 GLM-5 模型上有效。

VentureBeatMediaMar 27#sparse-attention#long-context
Page 5 of 9