🐼最新收集於 60m

Sugon 開放十萬卡 AI 超級叢集

Sugon 開放十萬卡 AI 超級叢集
PostLinkedIn
🐼閱讀原文: Pandaily

💡了解十萬卡國產叢集如何將 Qwen 最佳化轉化為實務系統訓練。

⚡ 30-Second TL;DR

有什麼變化

XianDao Cup 吸引來自 160 所大學、超過 500 支隊伍與 1,900 名學生參賽。

為什麼重要

將超大規模國產 AI 叢集提供給學生使用,有助於培養實務型系統人才,並為國產硬體創造新的最佳化技術。這也為 Qwen 與科學模型工作負載提供了具代表性的實驗場域。

下一步行動

將競賽題目作為實作清單:先在可用的加速器平台上分析 Qwen 推理效能,量測延遲、吞吐量與記憶體用量,再進行最佳化。

誰應關注:Researchers & Academics

關鍵要點

  • XianDao Cup 吸引來自 160 所大學、超過 500 支隊伍與 1,900 名學生參賽。
  • Sugon 提供中國首座全國產十萬卡 AI 超級叢集。
  • 競賽項目聚焦於 Qwen 推理最佳化與氣象模型部署。
  • 該叢集透過國家超算網際網路提供存取能力。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 該十萬卡叢集採用曙光自研的「曙光智算」架構,強調在軟硬體層面實現全棧國產化,以應對國際晶片出口限制帶來的供應鏈挑戰。
  • 國家超算網際網路(National Supercomputing Internet)作為該叢集的調度平台,旨在解決中國算力資源分散、供需不匹配的結構性問題。
  • 本次競賽不僅是人才選拔,更是一次大規模的壓力測試,旨在驗證國產 AI 晶片在處理超大規模分散式訓練與推理任務時的穩定性與互聯效率。
  • 曙光在本次部署中導入了自研的算力調度軟體,能有效降低大規模叢集在跨節點通訊時的延遲,提升模型訓練的線性加速比。
  • 該叢集支援多種國產深度學習框架(如昇思 MindSpore 等)的無縫銜接,降低了開發者從國外生態遷移至國產平台的技術門檻。
📊 競品分析▸ Show
特性曙光十萬卡叢集華為昇騰 AI 叢集阿里雲/騰訊雲智算中心
晶片架構全國產自研架構昇騰 (Ascend) 系列NVIDIA H100/A100 為主
生態系統國家超算網際網路昇騰生態 (CANN)公有雲生態 (CUDA)
主要優勢供應鏈自主可控軟硬體整合度高軟體生態成熟、易用性高
適用場景國家級科研、國防大規模商業模型訓練企業級 AI 應用部署

🛠️ 技術深入

  • 叢集互聯技術:採用曙光自研的高速互聯網路,支援 RDMA 技術以減少 CPU 參與通訊的開銷。
  • 儲存架構:配置了 PB 級別的並行檔案系統,專為 AI 大模型訓練中的高併發 I/O 需求進行了最佳化。
  • 軟體堆疊:整合了針對國產晶片指令集最佳化的算子庫,特別針對 Qwen 等 Transformer 架構模型進行了推理加速。
  • 散熱與能效:採用液冷技術方案,顯著降低了十萬卡規模叢集的 PUE 值,提升能源使用效率。

🔮 前景展望AI analysis grounded in cited sources

國產 AI 算力將逐步取代科研領域的進口設備
透過國家超算網際網路的普及,國產叢集在學術競賽與科研專案中的成功驗證,將加速高校與研究機構的設備國產化進程。
曙光將進一步開放算力資源以建立開發者生態
藉由舉辦大規模競賽吸引開發者,曙光正試圖透過降低使用門檻來擴大其國產算力平台的市佔率與軟體生態影響力。

時間線

2023-04
國家超算網際網路正式啟動建設,曙光作為核心參與單位加入。
2024-09
曙光發布新一代 AI 算力平台,強調國產化與大規模叢集擴展能力。
2025-06
曙光完成十萬卡級別 AI 超級叢集的初步部署與壓力測試。
2026-07
曙光透過國家超算網際網路正式向參賽隊伍開放十萬卡叢集資源。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily