🐼Pandaily•最新收集於 73m
中國啟用十萬卡國產 AI 超級叢集

#ai-accelerators#supercomputing#distributed-training#compute-networkdomestic-100,000-card-ai-super-clusterndrcnational supercomputing internetzhengzhougreater bay area
💡十萬卡國產叢集可能重新定義大規模 AI 工作負載的存取、成本與可移植性。
⚡ 30-Second TL;DR
有什麼變化
該叢集採用十萬張國產 AI 加速卡。
為什麼重要
這可能擴大國內大規模訓練與推理的可用算力,並降低對海外加速器的依賴。對 AI 公司而言,軟體相容性、排程存取權限,以及跨區域網路效能將成為主要實務問題。
下一步行動
在規劃國產加速器叢集工作負載前,先執行小型 PyTorch 分散式基準測試,確認框架、運算子與 checkpoint 的相容性。
誰應關注:Enterprise & Security Teams
關鍵要點
- •該叢集採用十萬張國產 AI 加速卡。
- •國家超級計算互聯網鄭州核心節點是主要部署地點。
- •粵港澳大灣區也正在進行平行叢集部署。
- •NDRC 正以全國算力網路為核心制定下一個五年規劃。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •該叢集採用了華為昇騰(Ascend)系列 AI 加速晶片,標誌著國產晶片在超大規模算力叢集調度能力上的重大突破。
- •鄭州節點的建設是「東數西算」工程的重要組成部分,旨在解決中西部地區算力資源與東部數據需求不匹配的問題。
- •該叢集採用了國產自研的互聯技術,旨在繞過美國對高階 GPU(如 NVIDIA H100/B200)的出口管制,實現算力基礎設施的自主可控。
- •除了硬體部署,該項目還整合了國產深度學習框架(如昇思 MindSpore),構建了從底層晶片到上層軟體生態的完整國產化鏈條。
- •國家發改委(NDRC)推動的統一算力網路不僅限於硬體,還包括建立全國統一的算力調度交易平台,以提升算力資源的利用效率。
📊 競品分析▸ Show
| 特性 | 國產十萬卡叢集 | NVIDIA DGX SuperPOD | Google TPU v5p Pod |
|---|---|---|---|
| 晶片架構 | 昇騰 (Ascend) | Blackwell/Hopper | TPU v5p |
| 互聯技術 | 國產自研 (HCCS) | NVLink/NVSwitch | ICI (Inter-Chip Interconnect) |
| 生態系統 | 昇思 (MindSpore) | CUDA | JAX/TensorFlow/PyTorch |
| 供應鏈狀態 | 自主可控 | 受出口管制限制 | 自研自用 |
🛠️ 技術深入
- 採用大規模分散式並行計算架構,支援萬億參數級大模型的訓練與推理。
- 整合了高速互聯技術,解決了大規模叢集在訓練時的通訊瓶頸問題。
- 具備液冷散熱技術,以應對十萬卡級別叢集的高功耗與高熱密度挑戰。
- 支援動態算力資源調度,可根據不同任務需求靈活分配算力資源。
🔮 前景展望AI analysis grounded in cited sources
中國將在 2027 年前實現國產 AI 算力在科研領域的全面替代。
隨著十萬卡叢集的成功部署,國產算力在穩定性與效能上已達到支撐國家級科研任務的門檻。
國產 AI 晶片供應鏈將進一步向成熟製程與先進封裝技術轉移。
為規避先進製程設備限制,產業鏈將更依賴先進封裝技術來提升晶片整體效能。
⏳ 時間線
2022-02
中國正式全面啟動「東數西算」工程,規劃全國算力網路佈局。
2023-10
國家超級計算互聯網正式上線,開始整合全國算力資源。
2025-06
鄭州核心節點完成基礎設施建設,開始進行大規模國產晶片測試。
2026-08
首座完全國產化的十萬卡 AI 超級叢集在鄭州正式啟用。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗



