💼較早收集於 27m

Mamba-3 以 4% 優勢超越 Transformer,延遲降低

Mamba-3 以 4% 優勢超越 Transformer,延遲降低
PostLinkedIn
💼閱讀原文: VentureBeat
#state-space-models#open-source-modelmamba-3mamba-3transformernvidianemotron-3-super

💡開源 Mamba-3 困惑度勝 Transformer 4% + 降低延遲:開發者 SSM 推論突破。(48字元)

⚡ 30-Second TL;DR

有什麼變化

以 Apache 2.0 授權釋出開源語言模型,可商業使用

為什麼重要

Mamba-3 挑戰 Transformer 主導地位,透過更快、更廉價的長上下文 LLM 推論,加速 SSM 在生產 AI 系統的採用。企業現可無專有限制商業部署高效模型。

下一步行動

從官方 GitHub/arXiv 連結儲存庫下載 Mamba-3 模型權重,並基準測試長提示推論延遲對比 Transformer 基準。

誰應關注:Researchers & Academics

關鍵要點

  • 以 Apache 2.0 授權釋出開源語言模型,可商業使用
  • 語言建模困惑度比 Transformer 優化約 4%
  • 專注推論效率,解決解碼時 GPU 閒置問題
  • 由 CMU 的 Albert Gu 及 Princeton 的 Tri Dao 開發,論文上 arXiv
  • 應用於 Nvidia Nemotron 3 Super 等混合模型

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Mamba-3 的 MIMO(多輸入多輸出)變體在 1.5B 規模下相比 Mamba-2 提升準確度 1.2 個百分點,同時保持與 Mamba-2 相當的推論速度,實現性能與延遲的帕累托最優[1][2]
  • Mamba-3 在狀態大小上實現 50% 的效率提升:MIMO 變體使用 64 的狀態大小可匹配 Mamba-2 使用 128 狀態大小的困惑度,有效將延遲降低一半[2]
  • 混合 Transformer-Mamba 架構(如 NVIDIA Nemotron 3 Super)通過將大多數自注意力層替換為 Mamba 層,在保持相當準確度的同時實現最高 3 倍的推論加速[4]
  • Mamba-3 採用複數值狀態更新規則和更具表達力的遞推公式,使其在檢索、狀態追蹤和下游語言建模任務上取得顯著進展[2]
📊 競品分析▸ Show
模型架構類型主要優勢推論延遲上下文長度
Mamba-3 SISO狀態空間模型最快的 prefill+decode 延遲最優標準
Mamba-3 MIMO狀態空間模型+1.8% 準確度提升與 Mamba-2 相當標準
Gated DeltaNet線性注意力強大的線性模型基準較慢標準
Llama-3.2-1BTransformer高度優化的推論生態較慢標準
NVIDIA Nemotron 3 Super混合 Mamba-MoE2.2-7.5× 吞吐量提升極優1M tokens

🛠️ 技術深入

  • 遞推公式改進:Mamba-3 採用源自 SSM 離散化的更具表達力的遞推公式,相比 Mamba-2 提升建模能力[2]
  • 複數值狀態追蹤:引入複數值狀態更新規則,實現更豐富的狀態表示和追蹤能力[1][2]
  • MIMO 變體架構:多輸入多輸出配置在不增加解碼延遲的前提下提升模型性能,相比 SISO 變體額外提升 1.2 個百分點準確度[1][2]
  • 狀態大小優化:Mamba-3 在各種狀態大小實驗中實現與 Mamba-2 相當的困惑度,同時使用狀態大小減半[2]
  • 混合架構應用:在 Nemotron 3 Super 中,Mamba 塊與稀疏激活的 MoE(專家混合)和策略性放置的注意力錨點結合,支持 120.6B 總參數,每次前向傳播僅 12.7B 活躍參數[3]
  • 推論優先設計:架構圍繞推論效率優化,通過利用 GPU 閒置核心來保持推論延遲恆定,同時增加每個時間步的 FLOPs[1]

🔮 前景展望AI analysis grounded in cited sources

狀態空間模型將成為長序列處理的主流架構
Mamba-3 在保持 50% 狀態大小優勢的同時匹配 Transformer 性能,表明 SSM 在效率-性能權衡上的優勢將推動其在生產環境中的廣泛採用[2]
混合 Mamba-MoE 架構將主導大規模模型設計
Nemotron 3 Super 展示的 2.2-7.5× 吞吐量提升和 1M token 上下文支持表明,混合架構將成為實現高效長上下文推論的標準方案[3]
推論效率將成為模型架構選擇的首要考量
2026 年 AI 產業從演示轉向生產部署,效率和系統約束成為關鍵因素,推動對 Mamba-3 等推論優先設計的採用[7]

時間線

2023-12
Mamba 原始架構發佈,由 CMU 的 Albert Gu 和 Princeton 的 Tri Dao 開發
2024-08
Mamba-2 發佈,優化訓練速度和模型性能
2025-12
NVIDIA Nemotron 3 Super 發佈,採用混合 Mamba-MoE 架構,實現 1M token 上下文和 2.2-7.5× 吞吐量提升
2026-03
Mamba-3 以 Apache 2.0 開源授權發佈,引入 MIMO 變體和複數值狀態追蹤,相比 Mamba-2 提升 1.8 個百分點準確度
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。