🦙Reddit r/LocalLLaMA•較早收集於 16h
DeepGEMM 更新確認 V4 的 mHC 與 Blackwell 支援
#matrix-mult#gpu-optimization#low-precisiondeepgemmdeepseekdeepgemmmhcblackwell
💡DeepGEMM 更新解鎖 V4 的 mHC + Blackwell/FP4—開源模型基礎設施提升(32字元)
⚡ 30-Second TL;DR
有什麼變化
整合 Manifold-constrained Hyper-connection (mHC)
為什麼重要
實現次世代 GPU 更快推論,提升開源效率。将 DeepSeek V4 置於硬體-軟體協同設計前列。
下一步行動
從 GitHub 拉取最新 DeepGEMM,在 Blackwell 模擬上基準測試 mHC。
誰應關注:Researchers & Academics
關鍵要點
- •整合 Manifold-constrained Hyper-connection (mHC)
- •新增 NVIDIA Blackwell SM100 支援
- •實作 FP4 超低精度運算
- •預示 DeepSeek V4 硬體最佳化
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •mHC透過Sinkhorn-Knopp演算法將殘差連接混合矩陣投影至Birkhoff多面體,恢復身份映射屬性並解決HC的信號爆炸問題。
- •在27B參數模型實驗中,mHC在BBH基準從基線43.8提升至51.0,優於HC的48.9,並顯著改善訓練穩定性。
- •mHC已擴展至圖神經網路(mHC-GNN),在128層深度維持74%以上準確率,遠超標準GNN的崩潰表現。
🛠️ 技術深入
- •mHC將殘差流擴展至n個平行流,使用Sinkhorn-Knopp正規化確保混合矩陣為雙隨機矩陣(doubly stochastic),每行每列總和為1。
- •解決HC的複合映射問題:L層後有效變換為∏ H_res^i,避免譜範數放大導致梯度爆炸(例如64層HC增益達10^3-10^5)。
- •在27B模型訓練中,mHC避免步驟12k的損失尖峰,梯度範數平滑;基準包括BBH(51.0)、GSM8K、MMLU均優於基線與HC。
🔮 前景展望AI analysis grounded in cited sources
mHC將成為Transformer後殘差架構標準擴展,提升大規模模型深度穩定性
其數學保證的身份映射允許堆疊60+層而不崩潰,如27B實驗所示,為DeepSeek V4等次世代模型提供基礎。
mHC原理可應用於MoE路由與注意力權重,改善負載平衡與表示崩潰
雙隨機約束類似於軟路由,已證實在GNN中防止過平滑,未來可擴展至其他組件如交叉注意力。
⏳ 時間線
2025-12
DeepSeek發布mHC論文(arXiv 2512.24880),提出Manifold-Constrained Hyper-Connections解決HC不穩定性
2026-01
mHC擴展至GNN(mHC-GNN, arXiv 2601.02451),證實極深架構(128層)效能
2026-02
DeepSeek更新DeepGEMM函式庫,整合mHC並支援Blackwell與FP4,確認V4硬體最佳化
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。