🏠最新收集於 17m

中國首個十萬卡 AI 超級集群正式投用

中國首個十萬卡 AI 超級集群正式投用
PostLinkedIn
🏠閱讀原文: IT之家

💡全國產十萬卡集群正式運行,AI 與科學計算進入超大規模部署階段。

⚡ 30-Second TL;DR

有什麼變化

該超級集群是中國首個全國產十萬卡 AI 部署系統。

為什麼重要

該系統的投入運行將強化中國自主 AI 基礎設施,並可能擴大大規模訓練、推理與科學計算資源的供應。其混合精度設計也有助於企業在同一平台上整合 AI 與高效能計算工作負載。

下一步行動

在申請使用十萬卡國產集群前,先評估你的訓練或科學計算流程是否能有效採用 FP64 至 INT8 的混合精度。

誰應關注:Researchers & Academics

關鍵要點

  • 該超級集群是中國首個全國產十萬卡 AI 部署系統。
  • 其每秒峰值算力據稱相當於全人類持續計算 200 年。
  • 系統支援新材料、創新藥、AI、工業模擬等 26 個領域的計算任務。
  • 曙光8000(登峰)採用超智融合架構,支援 FP64 至 INT8 的多種精度。
  • 浸沒式相變液冷技術可支援單機櫃 MW 級功率密度,並提升集群能效。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 該集群採用了曙光自主研發的「矽立方」液冷計算機技術,實現了 PUE 值低於 1.05 的極致能效表現。
  • 系統整合了國家超算互聯網的調度平台,實現了跨地域、跨架構的算力資源統一調度與分配。
  • 該項目是國家「東數西算」工程的重要組成部分,旨在解決國內大規模 AI 模型訓練對高端算力基礎設施的迫切需求。
  • 集群內部採用了高速互聯網絡架構,針對大規模並行計算進行了優化,顯著降低了萬卡級別訓練時的通信延遲。
  • 該系統不僅服務於科研機構,還向工業界開放,支持企業進行大規模工業仿真與複雜系統建模。
📊 競品分析▸ Show
特性中國十萬卡集群 (曙光)NVIDIA DGX SuperPOD華為昇騰 AI 集群
核心架構全國產超智融合架構NVIDIA Blackwell/Hopper昇騰 Ascend 910B/C
互聯技術自研高速互聯NVLink/NVSwitch昇騰集群互聯 (HCCS)
生態系統國產適配/超算互聯網CUDA 生態 (全球領先)CANN/MindSpore 生態
算力精度涵蓋 FP64 至 INT8側重 FP8/FP16/TF32側重 FP16/INT8

🛠️ 技術深入

  • 採用浸沒式相變液冷技術,實現了單機櫃功率密度達到 MW 級別,解決了高密度算力部署的散熱瓶頸。
  • 搭載曙光 8000 系列處理器,具備針對 AI 訓練優化的矩陣運算單元,支持多種混合精度計算。
  • 系統架構設計上實現了科學計算(HPC)與智能計算(AI)的深度融合,支持在同一集群上同時運行傳統數值模擬與深度學習任務。
  • 網絡層面採用了自研的高帶寬、低延遲互聯網絡,確保在十萬卡規模下依然能保持高效的數據同步與模型並行效率。

🔮 前景展望AI analysis grounded in cited sources

國產 AI 算力基礎設施將加速大模型訓練的國產化替代進程。
十萬卡級別的算力集群提供了足夠的基礎設施支撐,使得國內企業無需依賴進口 GPU 即可完成超大規模模型的訓練。
國家超算互聯網將成為中國算力資源配置的核心樞紐。
通過鄭州核心節點的成功運作,該模式將推廣至全國,實現算力資源像水電一樣的即插即用。

時間線

2023-04
國家超算互聯網正式啟動建設,旨在構建全國一體化算力網絡。
2024-01
曙光公司宣布啟動全國產 AI 超級集群研發項目。
2025-06
鄭州核心節點完成基礎設施建設,開始進行十萬卡規模的聯調聯試。
2026-08
中國首個全國產十萬卡 AI 超級集群正式投入運行。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家