🤖Reddit r/MachineLearning•最新收集於 14m
讓模型學會選擇注意力位置
#long-context#sparse-attention#kv-cachedeclarative-attentiondeclarative attentiongemma-4-31bqwen-3.6-27b
💡模型可自行選擇注意力範圍,讓長上下文注意力成本降低最多 52%。
⚡ 30-Second TL;DR
有什麼變化
此協定使用三種模式:global、focus 與 local 注意力。
為什麼重要
Declarative Attention 可能在不需額外相關性評分模型的情況下,降低長上下文應用的推論成本與延遲。其實用價值將取決於宣告的可靠性,尤其是模型選擇過窄上下文範圍時。
下一步行動
使用長上下文模型實作 Declarative Attention 原型,並在自己的檢索工作負載上測量 KV cache 讀取量、延遲與回答準確率。
誰應關注:Researchers & Academics
關鍵要點
- •此協定使用三種模式:global、focus 與 local 注意力。
- •推論引擎將模型宣告解析為類似工具呼叫的指令,跳過不必要的 KV cache 讀取。
- •零樣本測試顯示,注意力 token 大幅減少,而準確率損失相對有限。
- •此方法屬於內生式稀疏注意力,因為模型本身會判斷需要關注的位置。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。
