🤖較早收集於 3h

SSMs 在 25M 參數訓練中掙扎

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡SSMs 微型模型失敗原因:壓縮差 3 倍 + Parameter Golf kernel bug。

⚡ 30-Second TL;DR

有什麼變化

SSM in_proj 權重以 LZMA 壓縮比 QKV 差 3.26 倍

為什麼重要

暴露 SSM 在邊緣/嵌入式 AI 劣勢,目前推開發者轉 transformer。指引效率競賽中的 kernel 與架構優化。

下一步行動

重現 Mamba-3 混合精度修正,在您的 SSM 訓練減 0.8 mBPB。

誰應關注:Researchers & Academics

關鍵要點

  • SSM in_proj 權重以 LZMA 壓縮比 QKV 差 3.26 倍
  • SP4096 優勢在目標 SP8192 詞彙大小逆轉
  • Mamba-3 後向融合精確但 SMEM 壓力致慢 16%
  • torch.compile 量化器 bug 損 5.5 mBPB;混合精度回收 0.8 mBPB

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • OpenAI 的 Parameter Golf 實驗揭示了在極端資源受限(25M 參數)環境下,狀態空間模型(SSM)的權重冗餘度高於 Transformer,導致其在模型壓縮任務中表現不佳。
  • Mamba-3 的 Triton kernel 在處理長序列時雖然具備理論上的線性複雜度優勢,但在小規模模型中,其記憶體存取模式(SMEM 壓力)反而成為了限制吞吐量的瓶頸。
  • 研究指出,SSM 架構在處理大規模詞彙表(如 SP8192)時,其隱藏狀態的維度擴展需求會抵消掉原本在推理速度上的架構優勢,使其在特定任務中不如 Transformer 高效。
📊 競品分析▸ Show
特性Mamba-3 (SSM)Transformer (Attention)RWKV (Linear RNN)
複雜度線性 O(N)二次 O(N²)線性 O(N)
記憶體佔用低 (固定狀態)高 (KV Cache 隨長度增長)極低
訓練並行性極高
25M 參數表現壓縮效率較差基準參考中等

🛠️ 技術深入

  • Mamba-3 Triton Kernel 瓶頸:後向傳播過程中的融合操作雖然減少了記憶體讀寫次數,但由於共享記憶體(SMEM)頻寬限制,導致計算單元等待時間增加,整體效能下降 16%。
  • 量化與精度損失torch.compile 在處理 SSM 特有的狀態更新邏輯時,對量化算子的優化存在 bug,導致模型在 25M 參數規模下損失了 5.5 mBPB(bits per byte)。
  • 詞彙表擴展影響:當詞彙表從 4096 擴展至 8192 時,SSM 的投影矩陣參數佔比顯著增加,導致模型在極小參數限制下無法有效分配權重給核心狀態更新邏輯。

🔮 前景展望AI analysis grounded in cited sources

SSM 將在邊緣運算領域面臨 Transformer 的強勢回歸
隨著模型壓縮技術的進步,Transformer 在小參數規模下的表現已優於 SSM,壓縮了 SSM 在邊緣設備上的生存空間。
Triton kernel 優化將成為 SSM 發展的關鍵瓶頸
硬體架構對 SMEM 的依賴使得 SSM 的線性優勢在實際執行時被硬體頻寬限制所抵消。

時間線

2023-12
Mamba 論文發表,提出選擇性狀態空間模型
2024-05
Mamba-2 架構發布,引入結構化狀態空間對偶性
2026-02
OpenAI 啟動 Parameter Golf 實驗,針對微型模型進行架構對比
2026-04
Mamba-3 Triton kernel 實驗結果公開,揭露小參數下的效能瓶頸
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning