來源钛媒体•較早收集於 2m
曙光6萬卡叢集融合超算與超智

#gpu-cluster#supercomputing#ai-infrasugon-60k-gpu-clustersugon
中國6萬GPU叢集推出,升級AI算力軍備競賽,對從業人員意義重大。
30 秒速覽
有什麼變化
曙光部署6萬GPU卡叢集
為什麼重要
此叢集可提升中國AI訓練能力,加劇全球AI基礎設施競爭,並可能降低大規模模型成本。
下一步行動
針對下一個分散式AI訓練工作負載,將曙光叢集與AWS進行基準測試。
誰應關注:Enterprise & Security Teams
關鍵要點
- •曙光部署6萬GPU卡叢集
- •從超算轉向超智融合
- •重構中國算力產業格局
- •以「曙光速度」押注未來策略
深度解析
本篇為 AI 生成分析,非原文內容。
增強重點摘要
- •該叢集採用了曙光自主研發的液冷技術,以解決大規模GPU部署帶來的極高散熱密度與能耗挑戰,實現了PUE值(能源使用效率)的顯著優化。
- •此系統架構整合了曙光自研的「算力調度平台」,能夠在超算(科學計算)與超智(AI大模型訓練)任務之間實現動態資源切換,提升硬體利用率。
- •該項目標誌著曙光在國產AI晶片適配與互聯技術上的突破,透過自研的高速互聯網路架構,解決了萬卡規模下GPU集群的通訊瓶頸問題。
競品分析
核心架構
- 曙光6萬卡叢集
- 超算+超智融合
- 華為昇騰集群
- 昇騰AI處理器集群
- 阿里雲/騰訊雲智算中心
- 通用GPU+自研加速卡
互聯技術
- 曙光6萬卡叢集
- 自研高速互聯
- 華為昇騰集群
- Ascend Fabric
- 阿里雲/騰訊雲智算中心
- RDMA/自研互聯
適用場景
- 曙光6萬卡叢集
- 科學計算與大模型混合
- 華為昇騰集群
- 大模型訓練與推理
- 阿里雲/騰訊雲智算中心
- 公有雲AI算力租賃
| 特性 | 曙光6萬卡叢集 | 華為昇騰集群 | 阿里雲/騰訊雲智算中心 |
|---|---|---|---|
| 核心架構 | 超算+超智融合 | 昇騰AI處理器集群 | 通用GPU+自研加速卡 |
| 互聯技術 | 自研高速互聯 | Ascend Fabric | RDMA/自研互聯 |
| 適用場景 | 科學計算與大模型混合 | 大模型訓練與推理 | 公有雲AI算力租賃 |
技術深入
- 採用大規模液冷散熱系統,支援高密度機櫃部署,顯著降低機房冷卻能耗。
- 搭載自研的高速互聯網路架構,旨在降低萬卡規模下的通訊延遲與頻寬瓶頸。
- 軟體層面整合了異構算力調度引擎,支援多種主流AI框架與科學計算軟體的無縫遷移。
- 針對國產AI晶片進行了底層驅動與算子庫的深度優化,提升了訓練效率。
前景展望基於引用來源的 AI 分析
曙光將主導中國國產算力基礎設施的標準制定。
透過大規模集群的實戰部署,曙光積累的軟硬體協同經驗將成為後續國產算力中心建設的技術參考範本。
超算與超智融合將成為未來大型算力中心的標配架構。
單一功能的算力中心難以滿足科研與AI產業日益增長的混合型計算需求,資源利用率優化將驅動架構轉型。
時間線
2023-05
曙光發布「算力服務」戰略,明確超算與智算融合發展方向。
2024-09
曙光在全國算力大會展示其液冷技術在萬卡集群中的應用成果。
2026-03
曙光正式對外宣布完成6萬卡GPU叢集的部署與驗收。
- 2023-05曙光發布「算力服務」戰略,明確超算與智算融合發展方向。
- 2024-09曙光在全國算力大會展示其液冷技術在萬卡集群中的應用成果。
- 2026-03曙光正式對外宣布完成6萬卡GPU叢集的部署與驗收。
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体 ↗
每週電子報
每週一封,可隨時退訂。