來源較早收集於 73m

中國啟用十萬卡國產 AI 超級叢集

閱讀原文: Pandaily
#ai-accelerators#supercomputing#distributed-training#compute-network

十萬卡國產叢集可能重新定義大規模 AI 工作負載的存取、成本與可移植性。

30 秒速覽

有什麼變化

該叢集採用十萬張國產 AI 加速卡。

為什麼重要

這可能擴大國內大規模訓練與推理的可用算力,並降低對海外加速器的依賴。對 AI 公司而言,軟體相容性、排程存取權限,以及跨區域網路效能將成為主要實務問題。

下一步行動

在規劃國產加速器叢集工作負載前,先執行小型 PyTorch 分散式基準測試,確認框架、運算子與 checkpoint 的相容性。

誰應關注:Enterprise & Security Teams

關鍵要點

  • •該叢集採用十萬張國產 AI 加速卡。
  • •國家超級計算互聯網鄭州核心節點是主要部署地點。
  • •粵港澳大灣區也正在進行平行叢集部署。
  • •NDRC 正以全國算力網路為核心制定下一個五年規劃。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •該叢集採用了華為昇騰(Ascend)系列 AI 加速晶片,標誌著國產晶片在超大規模算力叢集調度能力上的重大突破。
  • •鄭州節點的建設是「東數西算」工程的重要組成部分,旨在解決中西部地區算力資源與東部數據需求不匹配的問題。
  • •該叢集採用了國產自研的互聯技術,旨在繞過美國對高階 GPU(如 NVIDIA H100/B200)的出口管制,實現算力基礎設施的自主可控。
  • •除了硬體部署,該項目還整合了國產深度學習框架(如昇思 MindSpore),構建了從底層晶片到上層軟體生態的完整國產化鏈條。
  • •國家發改委(NDRC)推動的統一算力網路不僅限於硬體,還包括建立全國統一的算力調度交易平台,以提升算力資源的利用效率。

競品分析

晶片架構
國產十萬卡叢集
昇騰 (Ascend)
NVIDIA DGX SuperPOD
Blackwell/Hopper
Google TPU v5p Pod
TPU v5p
互聯技術
國產十萬卡叢集
國產自研 (HCCS)
NVIDIA DGX SuperPOD
NVLink/NVSwitch
Google TPU v5p Pod
ICI (Inter-Chip Interconnect)
生態系統
國產十萬卡叢集
昇思 (MindSpore)
NVIDIA DGX SuperPOD
CUDA
Google TPU v5p Pod
JAX/TensorFlow/PyTorch
供應鏈狀態
國產十萬卡叢集
自主可控
NVIDIA DGX SuperPOD
受出口管制限制
Google TPU v5p Pod
自研自用

技術深入

  • 採用大規模分散式並行計算架構,支援萬億參數級大模型的訓練與推理。
  • 整合了高速互聯技術,解決了大規模叢集在訓練時的通訊瓶頸問題。
  • 具備液冷散熱技術,以應對十萬卡級別叢集的高功耗與高熱密度挑戰。
  • 支援動態算力資源調度,可根據不同任務需求靈活分配算力資源。

前景展望基於引用來源的 AI 分析

中國將在 2027 年前實現國產 AI 算力在科研領域的全面替代。
隨著十萬卡叢集的成功部署,國產算力在穩定性與效能上已達到支撐國家級科研任務的門檻。
國產 AI 晶片供應鏈將進一步向成熟製程與先進封裝技術轉移。
為規避先進製程設備限制,產業鏈將更依賴先進封裝技術來提升晶片整體效能。

時間線

2022-02
中國正式全面啟動「東數西算」工程,規劃全國算力網路佈局。
2023-10
國家超級計算互聯網正式上線,開始整合全國算力資源。
2025-06
鄭州核心節點完成基礎設施建設,開始進行大規模國產晶片測試。
2026-08
首座完全國產化的十萬卡 AI 超級叢集在鄭州正式啟用。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。