來源VentureBeat•較早收集於 18h
IndexCache 加速長上下文推理 1.82 倍

#sparse-attention#long-contextindexcacheindexcachedeepseekglm-5tsinghua-universityz.ai
💡DSA 模型 200k 令牌推理加速 1.82 倍—預填充成本減 75%(58字)
⚡ 30 秒速覽
有什麼變化
在 200k 令牌上實現 1.82 倍首 token 時間加速及 1.48 倍生成吞吐量
為什麼重要
IndexCache 使長上下文 AI 應用如文件處理及代理工作流程的推理更快、更廉價,有助企業部署生產級模型。它在降低預填充成本的同時維持輸出品質,有望加速擴展上下文視窗的採用。
下一步行動
在你的 DeepSeek 或 GLM 模型上測試 IndexCache 整合,以優化 200k+ 上下文推理。
誰應關注:Developers & AI Engineers
關鍵要點
- •在 200k 令牌上實現 1.82 倍首 token 時間加速及 1.48 倍生成吞吐量
- •減少 DeepSeek Sparse Attention (DSA) 索引器 75% 冗餘計算
- •解決 DSA lightning indexer 在各層的二次方複雜度
- •利用連續層間穩定的令牌選擇進行快取
- •在 744B 參數 GLM-5 模型上測試
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗
每週電子報
每週一封,可隨時退訂。