🐼最新收集於 73m

中國啟用十萬卡國產 AI 超級叢集

中國啟用十萬卡國產 AI 超級叢集
PostLinkedIn
🐼閱讀原文: Pandaily

💡十萬卡國產叢集可能重新定義大規模 AI 工作負載的存取、成本與可移植性。

⚡ 30-Second TL;DR

有什麼變化

該叢集採用十萬張國產 AI 加速卡。

為什麼重要

這可能擴大國內大規模訓練與推理的可用算力,並降低對海外加速器的依賴。對 AI 公司而言,軟體相容性、排程存取權限,以及跨區域網路效能將成為主要實務問題。

下一步行動

在規劃國產加速器叢集工作負載前,先執行小型 PyTorch 分散式基準測試,確認框架、運算子與 checkpoint 的相容性。

誰應關注:Enterprise & Security Teams

關鍵要點

  • 該叢集採用十萬張國產 AI 加速卡。
  • 國家超級計算互聯網鄭州核心節點是主要部署地點。
  • 粵港澳大灣區也正在進行平行叢集部署。
  • NDRC 正以全國算力網路為核心制定下一個五年規劃。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 該叢集採用了華為昇騰(Ascend)系列 AI 加速晶片,標誌著國產晶片在超大規模算力叢集調度能力上的重大突破。
  • 鄭州節點的建設是「東數西算」工程的重要組成部分,旨在解決中西部地區算力資源與東部數據需求不匹配的問題。
  • 該叢集採用了國產自研的互聯技術,旨在繞過美國對高階 GPU(如 NVIDIA H100/B200)的出口管制,實現算力基礎設施的自主可控。
  • 除了硬體部署,該項目還整合了國產深度學習框架(如昇思 MindSpore),構建了從底層晶片到上層軟體生態的完整國產化鏈條。
  • 國家發改委(NDRC)推動的統一算力網路不僅限於硬體,還包括建立全國統一的算力調度交易平台,以提升算力資源的利用效率。
📊 競品分析▸ Show
特性國產十萬卡叢集NVIDIA DGX SuperPODGoogle TPU v5p Pod
晶片架構昇騰 (Ascend)Blackwell/HopperTPU v5p
互聯技術國產自研 (HCCS)NVLink/NVSwitchICI (Inter-Chip Interconnect)
生態系統昇思 (MindSpore)CUDAJAX/TensorFlow/PyTorch
供應鏈狀態自主可控受出口管制限制自研自用

🛠️ 技術深入

  • 採用大規模分散式並行計算架構,支援萬億參數級大模型的訓練與推理。
  • 整合了高速互聯技術,解決了大規模叢集在訓練時的通訊瓶頸問題。
  • 具備液冷散熱技術,以應對十萬卡級別叢集的高功耗與高熱密度挑戰。
  • 支援動態算力資源調度,可根據不同任務需求靈活分配算力資源。

🔮 前景展望AI analysis grounded in cited sources

中國將在 2027 年前實現國產 AI 算力在科研領域的全面替代。
隨著十萬卡叢集的成功部署,國產算力在穩定性與效能上已達到支撐國家級科研任務的門檻。
國產 AI 晶片供應鏈將進一步向成熟製程與先進封裝技術轉移。
為規避先進製程設備限制,產業鏈將更依賴先進封裝技術來提升晶片整體效能。

時間線

2022-02
中國正式全面啟動「東數西算」工程,規劃全國算力網路佈局。
2023-10
國家超級計算互聯網正式上線,開始整合全國算力資源。
2025-06
鄭州核心節點完成基礎設施建設,開始進行大規模國產晶片測試。
2026-08
首座完全國產化的十萬卡 AI 超級叢集在鄭州正式啟用。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily