Search

Tag: #long-context86 results

IndexCache 加速長上下文推理 1.82 倍

IndexCache 加速長上下文推理 1.82 倍

IndexCache 是清華大學與 Z.ai 開發的稀疏注意力優化器,可減少 DSA 模型高達 75% 的冗餘計算,在 200k 令牌上實現 1.82 倍更快的首 token 時間及 1.48 倍更快的生成吞吐量。它針對 DeepSeek Sparse Attention 架構,適用於 DeepSeek 和 GLM 系列模型。初步測試證實其在 744B 參數的 GLM-5 模型上有效。

VentureBeatMediaMar 27#sparse-attention#long-context
Claude 1M 上下文窗口全面開放,定價統一

Claude 1M 上下文窗口全面開放,定價統一

Anthropic 正式全面開放 Claude Opus 4.6 和 Sonnet 4.6 的 100 萬 token 上下文窗口,並以標準價格計費,不再收取長上下文溢價。Opus 4.6 輸入每百萬 token 5 美元、輸出 25 美元;Sonnet 4.6 輸入 3 美元、輸出 15 美元。即使是 90 萬 token 的請求,單位 token 費用也與 9000 token 請求相同。

cnBeta (Full RSS)MediaMar 13#context-window#long-context#api-pricing
MIT Attention Matching 壓縮 KV 快取 50 倍

MIT Attention Matching 壓縮 KV 快取 50 倍

MIT 研究人員開發 Attention Matching,這是一種快速 KV 快取壓縮技術,可將 LLM 記憶體使用量減少高達 50 倍,幾乎無準確度損失。它解決了長上下文企業 AI 應用(如法律分析和多會話對話)的記憶體瓶頸。此方法在保留資訊方面優於驅逐、合併和摘要技術。

VentureBeatMediaMar 6#memory-compaction#long-context
Page 6 of 9