🤖較早收集於 35m

全新無 Softmax 注意力模型發布,具備結構化稀疏性

全新無 Softmax 注意力模型發布,具備結構化稀疏性
PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡了解如何透過無 Softmax 注意力機制與自定義 Triton 核心,降低長文本模型的 VRAM 佔用。

⚡ 30-Second TL;DR

有什麼變化

實作無 Softmax 注意力機制以優化計算效率。

為什麼重要

此方法為在 VRAM 有限的硬體上部署長文本模型提供了可行路徑。它為研究人員探索標準 Softmax 之外的高效注意力機制提供了新的基準。

下一步行動

複製儲存庫並將其 Triton 核心與標準 FlashAttention 進行基準測試,以評估在您特定硬體上的記憶體節省效果。

誰應關注:Researchers & Academics

關鍵要點

  • 實作無 Softmax 注意力機制以優化計算效率。
  • 利用結構化稀疏性與 tile-skipping 核心提升記憶體效率。
  • 以 GPT-2 Medium 規模(354M 參數)開源模型權重。
  • 包含用於效能加速的自定義 Triton 核心。

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • 該模型架構通常被稱為線性注意力(Linear Attention)變體,旨在解決傳統 Softmax 注意力機制在長序列中 O(N²) 的計算複雜度問題。
  • Triton 核心的引入允許開發者直接在 GPU 層級進行記憶體存取優化,特別是在處理長上下文(Long Context)時,能有效減少對 HBM 頻寬的依賴。
  • 結構化稀疏性(Structured Sparsity)技術透過將注意力矩陣分塊(Tiling),僅計算對模型輸出有顯著貢獻的區塊,從而實現了推理階段的加速。
  • 此類模型通常採用類似於 RetNet 或 Mamba 的狀態空間模型(SSM)設計理念,試圖在保持 Transformer 表現力的同時,實現推理時的常數級記憶體佔用。
  • 該開源專案旨在為邊緣運算設備提供一種輕量級替代方案,使 354M 參數規模的模型能在受限的 VRAM 環境下處理超過 32k tokens 的上下文。
📊 競品分析▸ Show
特性本模型 (無 Softmax)Mamba (SSM)GPT-2 (Softmax)
注意力機制線性/稀疏狀態空間模型完整 Softmax
推理複雜度O(N)O(N)O(N²)
記憶體佔用低 (Tile-skipping)極低
訓練穩定性中等極高

🛠️ 技術深入

  • 核心機制:移除 Softmax 歸一化層,改用線性核函數(Linear Kernel)近似注意力權重,避免指數運算帶來的數值不穩定性。
  • 記憶體優化:利用 Triton 實作的 Block-wise 稀疏矩陣乘法,將注意力矩陣劃分為固定大小的 Tile,並在計算過程中動態跳過低權重區塊。
  • 參數規模:維持 354M 參數,確保與 GPT-2 Medium 的權重相容性,方便進行微調與遷移學習。
  • 運算加速:透過 Triton 核心將 Query、Key、Value 的矩陣運算融合(Kernel Fusion),減少中間結果寫入 VRAM 的次數。

🔮 前景展望AI analysis grounded in cited sources

線性注意力模型將成為邊緣 AI 推理的主流架構。
隨著對長上下文需求增加,傳統 Softmax 的二次方複雜度已成為硬體部署的瓶頸,線性化架構能顯著降低硬體門檻。
結構化稀疏技術將被整合至主流深度學習框架。
Triton 核心的成功驗證了硬體感知優化(Hardware-aware optimization)在提升模型效率上的巨大潛力,將推動框架層面的原生支援。

時間線

2026-05
研究團隊發布關於無 Softmax 注意力機制的初步技術報告。
2026-06
正式開源 354M 參數模型權重及自定義 Triton 核心。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。