🔥36氪•較早收集於 10m
海光深算3號DCU適配混元Hy3大模型
#dcu-adaptation#china-ai-hardware#long-contexthaiguang-shensuan-3-dcuhaiguangshensuan-3tencenthunyuan-hy3
💡騰訊295B大模型優化中國DCU:基礎設施建造者變革。(28字元)
⚡ 30-Second TL;DR
有什麼變化
深算3號DCU與混元Hy3預覽完成深度適配
為什麼重要
實現國產AI晶片高效部署大模型,降低對Nvidia依賴,提升AI基礎設施自主性。
下一步行動
立即基準測試混元Hy3在海光DCU上的推理速度。
誰應關注:Developers & AI Engineers
關鍵要點
- •深算3號DCU與混元Hy3預覽完成深度適配
- •295B總參數,支援256K上下文長度
- •複雜推理、Agent能力及程式碼生成提升
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •此次適配採用了海光資訊自主研發的DCU(深度計算單元)軟體棧,針對混元Hy3模型的算子庫進行了底層優化,顯著提升了在國產硬體上的訓練與推理效率。
- •深算3號DCU在適配過程中,重點解決了超長上下文(256K)在分散式運算環境下的記憶體管理與通訊頻寬瓶頸,確保了大規模參數模型在國產算力叢集上的穩定性。
- •騰訊混元Hy3大模型透過此次適配,進一步擴展了其在金融、政務等對資料安全性與國產化率有嚴格要求的行業應用場景,實現了「模型+硬體」的國產化閉環。
📊 競品分析▸ Show
| 特性 | 海光深算3號DCU + 混元Hy3 | NVIDIA H100 + Llama 3 | 華為昇騰910B + 盤古大模型 |
|---|---|---|---|
| 算力架構 | DCU (GPGPU) | Hopper (GPU) | NPU (Da Vinci) |
| 參數規模 | 295B | 405B | 1000B+ |
| 上下文長度 | 256K | 128K+ | 200K+ |
| 生態優勢 | 國產化適配、金融政務 | 全球生態、CUDA | 國產化生態、全棧軟硬體 |
🛠️ 技術深入
- 架構特性:深算3號基於海光自主研發的DCU架構,支援FP16、BF16及INT8等多精度混合運算,專為大規模矩陣運算優化。
- 記憶體優化:針對295B參數模型,採用了模型並行(Model Parallelism)與流水線並行(Pipeline Parallelism)技術,優化了顯存佔用。
- 通訊優化:利用海光自研的高速互連技術,降低了多卡並行訓練時的通訊延遲,提升了長序列處理的吞吐量。
- 軟體棧:基於海光DCU軟體開發平台(DTK),相容主流深度學習框架(如PyTorch),實現了對混元模型算子的無縫對接與加速。
🔮 前景展望AI analysis grounded in cited sources
國產算力將在金融與政務大模型市場佔有率顯著提升。
隨著深算3號與混元等頂級國產模型的深度適配,解決了國產硬體在複雜推理場景下的軟體生態瓶頸。
海光資訊將加速推動DCU在超長上下文推理場景的標準化部署。
此次成功適配256K上下文模型,證明了其硬體架構在處理長序列任務上的成熟度,將推動更多行業採用國產算力進行長文件分析。
⏳ 時間線
2021-06
海光資訊發布深算1號DCU,正式進入通用GPU市場。
2023-05
海光資訊發布深算2號DCU,算力性能較前代大幅提升。
2024-09
海光資訊正式推出深算3號DCU,針對大模型訓練進行架構優化。
2026-05
海光資訊完成深算3號DCU與騰訊混元Hy3大模型的深度適配。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗
