🦙較早收集於 59m

DeepSeek 更新 DeepGEMM 支援 Mega MoE

DeepSeek 更新 DeepGEMM 支援 Mega MoE
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#moe#fp4#blackwell#distributed-trainingdeepgemmdeepseekdeepgemmmega-moeblackwell

💡DeepSeek 的 Mega MoE 優化暗示 V4 規模訓練於 Blackwell—大型模型建構者必看(42字)

⚡ 30-Second TL;DR

有什麼變化

在 DeepGEMM PR #304 新增 Mega MoE 測試

為什麼重要

這能實現在最新硬體上訓練與部署超大型 MoE 模型,可能加速開源可擴展 AI 的進展。從業人員可利用這些優化進行自身巨型模型實驗。

下一步行動

檢視 GitHub 上 DeepGEMM PR #304,並在 Blackwell 硬體上測試 Mega MoE 整合。

誰應關注:Researchers & Academics

關鍵要點

  • 在 DeepGEMM PR #304 新增 Mega MoE 測試
  • 支援用於大規模 MoE 推論的 P4 量化
  • 包含 Blackwell GPU 適配與分佈式訓練
  • 暗示 DeepSeek V4 為「Mega」規模模型

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • DeepGEMM 的更新顯示其核心算子庫正從單純的 FP8 矩陣乘法擴展至支援更低位元(如 FP4)的混合專家模型(MoE)架構,旨在解決超大規模模型在記憶體頻寬受限下的推論瓶頸。
  • 此次針對 NVIDIA Blackwell 架構的適配,特別強化了對 Tensor Core 在 FP4 運算模式下的指令集優化,這對於處理參數規模達到兆級(Trillion-parameter)的 MoE 模型至關重要。
  • HyperConnection 技術的引入表明 DeepSeek 正在探索超越傳統稀疏 MoE 的路由機制,透過更緊密的專家間通訊協定,以降低大規模分佈式訓練中的通訊開銷。
📊 競品分析▸ Show
特性DeepSeek (Mega MoE)OpenAI (GPT-5/o1)Mistral (Mixtral)
架構超大規模稀疏 MoE混合架構 (推測)稀疏 MoE
量化支援原生 FP4/P4專有量化FP8/INT8
硬體優化Blackwell (B200)H100/B200通用 GPU
開源策略高度開放 (DeepGEMM)閉源開放權重

🛠️ 技術深入

• DeepGEMM 核心優化:針對 Blackwell 架構的 FP4 矩陣乘法(GEMM)算子,利用 Tensor Core 的新指令集實現高吞吐量。 • 分佈式通訊:整合了針對 Mega MoE 專家分佈的 All-to-All 通訊優化,減少在多節點訓練時的同步延遲。 • HyperConnection:一種新型的專家連接機制,旨在動態調整專家間的資訊流,以提升模型在處理長上下文時的推理效率。 • P4 量化:採用 4-bit 浮點數格式,在保持模型精度的同時,顯著降低了模型權重佔用的 VRAM,使超大規模模型能在有限的 GPU 叢集上運行。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 將在 2026 年下半年發布參數規模超過 2 兆的 V4 模型。
DeepGEMM 對 Mega MoE 與 Blackwell 的深度適配,是為了支撐超大規模模型訓練與推論的必要基礎設施準備。
FP4 量化將成為下一代超大規模模型推論的行業標準。
隨著模型參數量的指數級增長,FP4 提供的記憶體壓縮比與運算效能提升,是解決推論成本瓶頸的關鍵技術路徑。

時間線

2024-01
DeepSeek 發布 DeepSeek-V2,引入多頭潛在注意力 (MLA) 與 DeepSeekMoE 架構。
2024-12
DeepSeek 發布 DeepSeek-V3,進一步優化 MoE 訓練效率與推論效能。
2025-05
DeepSeek 開源 DeepGEMM 儲存庫,專注於高效能矩陣乘法算子。
2026-04
DeepGEMM 更新,新增對 Mega MoE、FP4 量化及 Blackwell 架構的支援。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。