🦙較早收集於 5h

MiniMax 放棄混合注意力轉全注意力

MiniMax 放棄混合注意力轉全注意力
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#attention-mechanism#long-context#benchmarksminimax-text-01minimax-text-01deepseek-v3.2qwen3.5-397b-a17b

💡MiniMax 為何棄混合注意力 + 新 OS 模型長上下文勝出(42字)

⚡ 30-Second TL;DR

有什麼變化

混合注意力在 MMLU 等飽和基準上與全注意力匹敵,但複雜推理失敗

為什麼重要

強調需要超越標準基準的高級評估,影響未來 LLM 架構選擇。

下一步行動

測試 DeepSeek V3.2 在多跳推理基準上,與混合設定比較。

誰應關注:Researchers & Academics

關鍵要點

  • 混合注意力在 MMLU 等飽和基準上與全注意力匹敵,但複雜推理失敗
  • MiniMax 開發代理指標修復缺陷,但質疑大規模相關性
  • DeepSeek V3.2 和 Qwen3.5-397B-A17B 證明長上下文高效全注意力

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • MiniMax-M1於2025年6月17日發布,為全球首個開源大規模混合注意力推理模型,採用MoE架構結合Lightning注意力機制,支持100萬token上下文窗口。
  • MiniMax-Text-01作為M1的前身模型,使用線性注意力處理高達400萬token上下文,並整合softmax注意力於每7層線性注意力後,共80層。
  • MiniMax-M2為230B參數新模型,已放棄線性注意力,回歸標準注意力,因線性注意力在生產環境中於推理和多輪任務表現不佳。
  • MiniMax-M1訓練成本僅53.47萬美元,使用CISPO演算法優化強化學習,提升效率並縮短訓練時間至三週。
📊 競品分析▸ Show
模型架構參數規模上下文長度基準表現
MiniMax-M1混合注意力 + MoE + Lightning456B總/45.9B激活1M輸入/80K輸出超越DeepSeek R1及Llama 3.1[1][2][4]
DeepSeek R1標準注意力未詳較小MiniMax-M1使用25%計算資源即超越[6]
DeepSeek V3.2線性注意力變體未詳長上下文全注意力高效長上下文[7]
Qwen3-Next線性注意力變體未詳長上下文類似MiniMax-M1架構轉變[7]

🛠️ 技術深入

  • MiniMax-M1總參數4560億,每token激活459億,32個專家MoE架構。
  • Lightning注意力將計算複雜度從O(n²)降至O(n log n),支援1M token輸入與80K輸出。
  • 架構整合線性注意力與softmax注意力,每7個Transformer塊後置softmax層,共80層,每層64頭頭維度128,使用Group Query Attention。
  • MiniMax-Text-01支援400萬token上下文,開發優化並行策略與計算通訊重疊技術。
  • CISPO(Clipped Importance Sampling Policy Optimization)演算法提升RL微調效率。

🔮 前景展望AI analysis grounded in cited sources

混合注意力將被全注意力取代成為主流
MiniMax從M1混合轉M2全注意力,證明線性注意力在生產推理任務缺陷明顯,其他團隊如DeepSeek V3.2亦轉高效全注意力。
開源長上下文模型訓練成本將持續降低
MiniMax-M1僅53.47萬美元即達前沿性能,CISPO等優化將推動更多團隊複製此效率。
代理應用將優先全注意力長上下文模型
MiniMax承認混合注意力在大規模多跳推理失敗,全注意力模型如Qwen3.5證明更適合代理架構。

時間線

2025-01
發布MiniMax-Text-01,前身模型引入混合線性與softmax注意力,支持400萬token上下文
2025-06
發布MiniMax-M1,首個開源大規模混合注意力MoE模型,456B參數
2026-03
MiniMax宣布放棄混合注意力轉全注意力,因多跳推理缺陷,回顧Text-01經驗
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。