🤝Together AI Blog•較早收集於 17h
Mamba-3:專為推理優化的 SSM
.jpg)
#ssm#inference#state-space-modelmamba-3mamba-3together-aimamba-2
💡開源 SSM 解碼勝 Transformer – 革新您的推理管線!
⚡ 30-Second TL;DR
有什麼變化
專為推理工作負載設計的 SSM
為什麼重要
Mamba-3 挑戰 Transformer 在推理上的主導地位,讓部署更具成本效益。開源存取加速開發者和研究者的採用。
下一步行動
從 Together AI 克隆 Mamba-3 儲存庫,並在您的 GPU 上基準測試解碼速度。
誰應關注:Developers & AI Engineers
關鍵要點
- •專為推理工作負載設計的 SSM
- •解碼速度快於 Transformer
- •效能優於 Mamba-2
- •從發布日起開源
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Mamba-3 採用 MIMO (Multi-Input Multi-Output) 公式取代 SISO,提升硬體利用率並解決記憶體頻寬瓶頸,使運算強度從 2.5 FLOPs/byte 提高至計算受限領域。[1]
- •Mamba-3 在 FineWeb-Edu 資料集上,從 180M 到 1.5B 參數規模,困惑度 (perplexity) 優於 Mamba-2 及 Gated DeltaNet,並在檢索、狀態追蹤及語言建模任務中顯著進步。[1][2]
- •Mamba-3 透過複數動態提升狀態追蹤任務能力 (如奇偶性或算術),同時改善離散化以提高品質,在標準語言基準如 HellaSwag、PIQA、ARC Challenge 上超越同規模 Transformer。[1][2]
🛠️ 技術深入
- •採用 MIMO 公式進行狀態更新,避免 SISO 的外積運算低算術強度 (≈2.5 FLOPs/byte),透過增加 rank r 提升 FLOPs/byte 至 GPU 容量 (如 H100 ~300 FLOPs/byte),不增加遞迴狀態大小 H_t。[1]
- •引入複數動態恢復線性模型的表達力,解決狀態追蹤弱點;改善離散化提升品質;Myo 變體在 440M 規模平均準確率提升 1.2 點。[2]
- •Pareto 前沿分析顯示,在固定推理預算下,Mamba-3 將效能曲線向下左移,交換多餘計算換取更低困惑度,無需增加記憶體。[1][2]
- •模型規模 180M 至 1.5B 參數,在 FineWeb-Edu 上驗證品質與能力;在長序列 (>16k tokens) 記憶體效率達 Transformer 的 12.46x,推理速度 10.67x (4k tokens)。[1][4]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2023-12
Mamba 原版發布,引入選擇性狀態空間模型,推理吞吐量達 Transformer 的 5 倍
2024-01
Mamba-2 推出,透過結構化半可分離矩陣連結 SSM 與注意力,推理速度 2-8 倍提升
2026-03
Together AI 發布 Mamba-3,專為推理優化,MIMO 架構超越 Mamba-2 及 Transformer
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Together AI Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。