🦙Reddit r/LocalLLaMA•較早收集於 5h
MiniMax 放棄混合注意力轉全注意力

#attention-mechanism#long-context#benchmarksminimax-text-01minimax-text-01deepseek-v3.2qwen3.5-397b-a17b
💡MiniMax 為何棄混合注意力 + 新 OS 模型長上下文勝出(42字)
⚡ 30-Second TL;DR
有什麼變化
混合注意力在 MMLU 等飽和基準上與全注意力匹敵,但複雜推理失敗
為什麼重要
強調需要超越標準基準的高級評估,影響未來 LLM 架構選擇。
下一步行動
測試 DeepSeek V3.2 在多跳推理基準上,與混合設定比較。
誰應關注:Researchers & Academics
關鍵要點
- •混合注意力在 MMLU 等飽和基準上與全注意力匹敵,但複雜推理失敗
- •MiniMax 開發代理指標修復缺陷,但質疑大規模相關性
- •DeepSeek V3.2 和 Qwen3.5-397B-A17B 證明長上下文高效全注意力
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •MiniMax-M1於2025年6月17日發布,為全球首個開源大規模混合注意力推理模型,採用MoE架構結合Lightning注意力機制,支持100萬token上下文窗口。
- •MiniMax-Text-01作為M1的前身模型,使用線性注意力處理高達400萬token上下文,並整合softmax注意力於每7層線性注意力後,共80層。
- •MiniMax-M2為230B參數新模型,已放棄線性注意力,回歸標準注意力,因線性注意力在生產環境中於推理和多輪任務表現不佳。
- •MiniMax-M1訓練成本僅53.47萬美元,使用CISPO演算法優化強化學習,提升效率並縮短訓練時間至三週。
🛠️ 技術深入
- •MiniMax-M1總參數4560億,每token激活459億,32個專家MoE架構。
- •Lightning注意力將計算複雜度從O(n²)降至O(n log n),支援1M token輸入與80K輸出。
- •架構整合線性注意力與softmax注意力,每7個Transformer塊後置softmax層,共80層,每層64頭頭維度128,使用Group Query Attention。
- •MiniMax-Text-01支援400萬token上下文,開發優化並行策略與計算通訊重疊技術。
- •CISPO(Clipped Importance Sampling Policy Optimization)演算法提升RL微調效率。
🔮 前景展望AI analysis grounded in cited sources
混合注意力將被全注意力取代成為主流
MiniMax從M1混合轉M2全注意力,證明線性注意力在生產推理任務缺陷明顯,其他團隊如DeepSeek V3.2亦轉高效全注意力。
開源長上下文模型訓練成本將持續降低
MiniMax-M1僅53.47萬美元即達前沿性能,CISPO等優化將推動更多團隊複製此效率。
代理應用將優先全注意力長上下文模型
MiniMax承認混合注意力在大規模多跳推理失敗,全注意力模型如Qwen3.5證明更適合代理架構。
⏳ 時間線
2025-01
發布MiniMax-Text-01,前身模型引入混合線性與softmax注意力,支持400萬token上下文
2025-06
發布MiniMax-M1,首個開源大規模混合注意力MoE模型,456B參數
2026-03
MiniMax宣布放棄混合注意力轉全注意力,因多跳推理缺陷,回顧Text-01經驗
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- atalupadhyay.wordpress.com — Minimax M1 the Game Changing Open Source AI Model
- pro.pandaily.com — Chinas AI Challenger Minimax Open
- arXiv — 2506
- youtube.com — Watch
- filecdn.minimax.chat — Arxiv Minimax 01 Report
- adam.holter.com — Minimax M1 the First Open Source Hybrid Reasoning Model That Actually Delivers
- magazine.sebastianraschka.com — Beyond Standard Llms
- remio.ai — Minimax M2 Model a Deep Dive Into the AI Coding Powerhouse
- GitHub — Minimax M1
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
