
MiniMax 發布支援 1M Context 的稀疏注意力架構
MiniMax 推出了 MiniMax Sparse Attention (MSA),這是一種支援原生 1M token 上下文視窗的架構。透過重組記憶體存取模式並避開標準的二次方複雜度,該架構實現了顯著的速度提升。
Tag: #attention-mechanism19 results

MiniMax 推出了 MiniMax Sparse Attention (MSA),這是一種支援原生 1M token 上下文視窗的架構。透過重組記憶體存取模式並避開標準的二次方複雜度,該架構實現了顯著的速度提升。

一款全新的 354M 參數注意力模型已發布,採用無 Softmax 架構與自定義 Triton 核心。該模型利用結構化稀疏性與 tile-skipping 技術,顯著降低長文本任務的 VRAM 佔用。

研究人員發現注意力頭部的不平衡導致多模態模型優先考慮錯誤的文本而非視覺證據。他們提出了 MACI,這是一種在推理過程中抑制幻覺驅動頭部的干預方法,以提高模型準確性。
探討大模型架構的下半場,引入Flash Depth Attention與混合深度注意力。此機制實現LLM更深層擴展。聚焦巨型模型深度延伸。
FlashAttention-PyTorch 儲存庫更新,包含 FA1-FA4 的純 PyTorch 實作,強調演算法演進。聚焦設計變更,從 tiled softmax 到進階排程器,不含 CUDA 最佳化。旨在透過乾淨程式碼釐清「FA1 到 FA4 的變化為何?」

北大團隊重構 DeepSeek 注意力,速度提升 4 倍且不失精度。此修改完全即插即用,無需重訓。顯著提升 LLM 推論效率。

PyTorch 推出廣義點積注意力 (GDPA),這是標準點積注意力 (SDPA) 的變體,將 softmax 操作替換以解決 GPU 訓練核心的現實挑戰。此核心設計提升 transformer 模型訓練效率。

這篇 arXiv 論文從語言學詞性(POS)和句法原則出發,推導 Transformer 中查詢-鍵-值(QKV)機制的核心。本文統一解釋 MQA、GQA 和 MLA 架構的有效性,引入 QV 範式並提供實證驗證,並提出經實驗驗證的 QV-Ka 優化方案。

Kimi推出突破性新架構,讓Elon Musk嘆服。此創新將注意力機制「旋轉90度」。由17歲高中生作者創作,一戰成名。

埃隆·馬斯克公開點讚Kimi的全新Attention Residuals(注意力殘差)機制。Kimi官方帳號以幽默口吻回應馬斯克。此創新對深度學習領域近十年的傳統殘差連接進行顛覆性重構。