💼VentureBeat•較早收集於 27m
Mamba-3 以 4% 優勢超越 Transformer,延遲降低

#state-space-models#open-source-modelmamba-3mamba-3transformernvidianemotron-3-super
💡開源 Mamba-3 困惑度勝 Transformer 4% + 降低延遲:開發者 SSM 推論突破。(48字元)
⚡ 30-Second TL;DR
有什麼變化
以 Apache 2.0 授權釋出開源語言模型,可商業使用
為什麼重要
Mamba-3 挑戰 Transformer 主導地位,透過更快、更廉價的長上下文 LLM 推論,加速 SSM 在生產 AI 系統的採用。企業現可無專有限制商業部署高效模型。
下一步行動
從官方 GitHub/arXiv 連結儲存庫下載 Mamba-3 模型權重,並基準測試長提示推論延遲對比 Transformer 基準。
誰應關注:Researchers & Academics
關鍵要點
- •以 Apache 2.0 授權釋出開源語言模型,可商業使用
- •語言建模困惑度比 Transformer 優化約 4%
- •專注推論效率,解決解碼時 GPU 閒置問題
- •由 CMU 的 Albert Gu 及 Princeton 的 Tri Dao 開發,論文上 arXiv
- •應用於 Nvidia Nemotron 3 Super 等混合模型
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Mamba-3 的 MIMO(多輸入多輸出)變體在 1.5B 規模下相比 Mamba-2 提升準確度 1.2 個百分點,同時保持與 Mamba-2 相當的推論速度,實現性能與延遲的帕累托最優[1][2]
- •Mamba-3 在狀態大小上實現 50% 的效率提升:MIMO 變體使用 64 的狀態大小可匹配 Mamba-2 使用 128 狀態大小的困惑度,有效將延遲降低一半[2]
- •混合 Transformer-Mamba 架構(如 NVIDIA Nemotron 3 Super)通過將大多數自注意力層替換為 Mamba 層,在保持相當準確度的同時實現最高 3 倍的推論加速[4]
- •Mamba-3 採用複數值狀態更新規則和更具表達力的遞推公式,使其在檢索、狀態追蹤和下游語言建模任務上取得顯著進展[2]
📊 競品分析▸ Show
| 模型 | 架構類型 | 主要優勢 | 推論延遲 | 上下文長度 |
|---|---|---|---|---|
| Mamba-3 SISO | 狀態空間模型 | 最快的 prefill+decode 延遲 | 最優 | 標準 |
| Mamba-3 MIMO | 狀態空間模型 | +1.8% 準確度提升 | 與 Mamba-2 相當 | 標準 |
| Gated DeltaNet | 線性注意力 | 強大的線性模型基準 | 較慢 | 標準 |
| Llama-3.2-1B | Transformer | 高度優化的推論生態 | 較慢 | 標準 |
| NVIDIA Nemotron 3 Super | 混合 Mamba-MoE | 2.2-7.5× 吞吐量提升 | 極優 | 1M tokens |
🛠️ 技術深入
- 遞推公式改進:Mamba-3 採用源自 SSM 離散化的更具表達力的遞推公式,相比 Mamba-2 提升建模能力[2]
- 複數值狀態追蹤:引入複數值狀態更新規則,實現更豐富的狀態表示和追蹤能力[1][2]
- MIMO 變體架構:多輸入多輸出配置在不增加解碼延遲的前提下提升模型性能,相比 SISO 變體額外提升 1.2 個百分點準確度[1][2]
- 狀態大小優化:Mamba-3 在各種狀態大小實驗中實現與 Mamba-2 相當的困惑度,同時使用狀態大小減半[2]
- 混合架構應用:在 Nemotron 3 Super 中,Mamba 塊與稀疏激活的 MoE(專家混合)和策略性放置的注意力錨點結合,支持 120.6B 總參數,每次前向傳播僅 12.7B 活躍參數[3]
- 推論優先設計:架構圍繞推論效率優化,通過利用 GPU 閒置核心來保持推論延遲恆定,同時增加每個時間步的 FLOPs[1]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2023-12
Mamba 原始架構發佈,由 CMU 的 Albert Gu 和 Princeton 的 Tri Dao 開發
2024-08
Mamba-2 發佈,優化訓練速度和模型性能
2025-12
NVIDIA Nemotron 3 Super 發佈,採用混合 Mamba-MoE 架構,實現 1M token 上下文和 2.2-7.5× 吞吐量提升
2026-03
Mamba-3 以 Apache 2.0 開源授權發佈,引入 MIMO 變體和複數值狀態追蹤,相比 Mamba-2 提升 1.8 個百分點準確度
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗
每週 AI 簡報
每週一封,可隨時退訂。