🦙較早收集於 16h

DeepGEMM 更新確認 V4 的 mHC 與 Blackwell 支援

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#matrix-mult#gpu-optimization#low-precisiondeepgemmdeepseekdeepgemmmhcblackwell

💡DeepGEMM 更新解鎖 V4 的 mHC + Blackwell/FP4—開源模型基礎設施提升(32字元)

⚡ 30-Second TL;DR

有什麼變化

整合 Manifold-constrained Hyper-connection (mHC)

為什麼重要

實現次世代 GPU 更快推論,提升開源效率。将 DeepSeek V4 置於硬體-軟體協同設計前列。

下一步行動

從 GitHub 拉取最新 DeepGEMM,在 Blackwell 模擬上基準測試 mHC。

誰應關注:Researchers & Academics

關鍵要點

  • 整合 Manifold-constrained Hyper-connection (mHC)
  • 新增 NVIDIA Blackwell SM100 支援
  • 實作 FP4 超低精度運算
  • 預示 DeepSeek V4 硬體最佳化

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • mHC透過Sinkhorn-Knopp演算法將殘差連接混合矩陣投影至Birkhoff多面體,恢復身份映射屬性並解決HC的信號爆炸問題。
  • 在27B參數模型實驗中,mHC在BBH基準從基線43.8提升至51.0,優於HC的48.9,並顯著改善訓練穩定性。
  • mHC已擴展至圖神經網路(mHC-GNN),在128層深度維持74%以上準確率,遠超標準GNN的崩潰表現。

🛠️ 技術深入

  • mHC將殘差流擴展至n個平行流,使用Sinkhorn-Knopp正規化確保混合矩陣為雙隨機矩陣(doubly stochastic),每行每列總和為1。
  • 解決HC的複合映射問題:L層後有效變換為∏ H_res^i,避免譜範數放大導致梯度爆炸(例如64層HC增益達10^3-10^5)。
  • 在27B模型訓練中,mHC避免步驟12k的損失尖峰,梯度範數平滑;基準包括BBH(51.0)、GSM8K、MMLU均優於基線與HC。

🔮 前景展望AI analysis grounded in cited sources

mHC將成為Transformer後殘差架構標準擴展,提升大規模模型深度穩定性
其數學保證的身份映射允許堆疊60+層而不崩潰,如27B實驗所示,為DeepSeek V4等次世代模型提供基礎。
mHC原理可應用於MoE路由與注意力權重,改善負載平衡與表示崩潰
雙隨機約束類似於軟路由,已證實在GNN中防止過平滑,未來可擴展至其他組件如交叉注意力。

時間線

2025-12
DeepSeek發布mHC論文(arXiv 2512.24880),提出Manifold-Constrained Hyper-Connections解決HC不穩定性
2026-01
mHC擴展至GNN(mHC-GNN, arXiv 2601.02451),證實極深架構(128層)效能
2026-02
DeepSeek更新DeepGEMM函式庫,整合mHC並支援Blackwell與FP4,確認V4硬體最佳化
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。