🔥較早收集於 10m

海光深算3號DCU適配混元Hy3大模型

海光深算3號DCU適配混元Hy3大模型
PostLinkedIn
🔥閱讀原文: 36氪

💡騰訊295B大模型優化中國DCU:基礎設施建造者變革。(28字元)

⚡ 30-Second TL;DR

有什麼變化

深算3號DCU與混元Hy3預覽完成深度適配

為什麼重要

實現國產AI晶片高效部署大模型,降低對Nvidia依賴,提升AI基礎設施自主性。

下一步行動

立即基準測試混元Hy3在海光DCU上的推理速度。

誰應關注:Developers & AI Engineers

關鍵要點

  • 深算3號DCU與混元Hy3預覽完成深度適配
  • 295B總參數,支援256K上下文長度
  • 複雜推理、Agent能力及程式碼生成提升

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 此次適配採用了海光資訊自主研發的DCU(深度計算單元)軟體棧,針對混元Hy3模型的算子庫進行了底層優化,顯著提升了在國產硬體上的訓練與推理效率。
  • 深算3號DCU在適配過程中,重點解決了超長上下文(256K)在分散式運算環境下的記憶體管理與通訊頻寬瓶頸,確保了大規模參數模型在國產算力叢集上的穩定性。
  • 騰訊混元Hy3大模型透過此次適配,進一步擴展了其在金融、政務等對資料安全性與國產化率有嚴格要求的行業應用場景,實現了「模型+硬體」的國產化閉環。
📊 競品分析▸ Show
特性海光深算3號DCU + 混元Hy3NVIDIA H100 + Llama 3華為昇騰910B + 盤古大模型
算力架構DCU (GPGPU)Hopper (GPU)NPU (Da Vinci)
參數規模295B405B1000B+
上下文長度256K128K+200K+
生態優勢國產化適配、金融政務全球生態、CUDA國產化生態、全棧軟硬體

🛠️ 技術深入

  • 架構特性:深算3號基於海光自主研發的DCU架構,支援FP16、BF16及INT8等多精度混合運算,專為大規模矩陣運算優化。
  • 記憶體優化:針對295B參數模型,採用了模型並行(Model Parallelism)與流水線並行(Pipeline Parallelism)技術,優化了顯存佔用。
  • 通訊優化:利用海光自研的高速互連技術,降低了多卡並行訓練時的通訊延遲,提升了長序列處理的吞吐量。
  • 軟體棧:基於海光DCU軟體開發平台(DTK),相容主流深度學習框架(如PyTorch),實現了對混元模型算子的無縫對接與加速。

🔮 前景展望AI analysis grounded in cited sources

國產算力將在金融與政務大模型市場佔有率顯著提升。
隨著深算3號與混元等頂級國產模型的深度適配,解決了國產硬體在複雜推理場景下的軟體生態瓶頸。
海光資訊將加速推動DCU在超長上下文推理場景的標準化部署。
此次成功適配256K上下文模型,證明了其硬體架構在處理長序列任務上的成熟度,將推動更多行業採用國產算力進行長文件分析。

時間線

2021-06
海光資訊發布深算1號DCU,正式進入通用GPU市場。
2023-05
海光資訊發布深算2號DCU,算力性能較前代大幅提升。
2024-09
海光資訊正式推出深算3號DCU,針對大模型訓練進行架構優化。
2026-05
海光資訊完成深算3號DCU與騰訊混元Hy3大模型的深度適配。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪