
騰訊混元發布 Stem 稀疏注意力算法
騰訊混元開發了 Stem 稀疏注意力算法,將首字延遲降低了 3.6 倍。該方法透過 Token 位置衰減 (TPD) 和輸出感知度量 (OAM) 兩項創新,僅需 25% 的算力預算即可達到接近稠密注意力的精度。
Tag: #sparse-attention5 results

騰訊混元開發了 Stem 稀疏注意力算法,將首字延遲降低了 3.6 倍。該方法透過 Token 位置衰減 (TPD) 和輸出感知度量 (OAM) 兩項創新,僅需 25% 的算力預算即可達到接近稠密注意力的精度。

MiniMax 公布了 M2 系列模型的技術細節,並預告了即將推出的 M3 模型。該模型採用全新的稀疏注意力機制,使長文本解碼速度提升了 15.6 倍。

研究人員為視覺 Transformer 引入了一種新的骨幹架構,採用核心-周邊區塊稀疏注意力結構。此方法允許在測試時調整推理成本,同時保持具競爭力的準確度。

IndexCache 是清華大學與 Z.ai 開發的稀疏注意力優化器,可減少 DSA 模型高達 75% 的冗餘計算,在 200k 令牌上實現 1.82 倍更快的首 token 時間及 1.48 倍更快的生成吞吐量。它針對 DeepSeek Sparse Attention 架構,適用於 DeepSeek 和 GLM 系列模型。初步測試證實其在 744B 參數的 GLM-5 模型上有效。
Monodratic 是一種稀疏因果注意力架構,利用學習式乘積雜湊路由選取遠端來源區塊,同時保留保證的區域注意力。在合成聯想回憶任務中,使用兩個遠端區塊時平均準確率達 99.35%,CPU 測試的擬合伸縮指數約為 0.993,接近線性。