🇨🇳較早收集於 23m

中國推出無 GPU 的 LineShine 超級電腦,搭載 245 萬個國產 CPU 核心

中國推出無 GPU 的 LineShine 超級電腦,搭載 245 萬個國產 CPU 核心
PostLinkedIn
🇨🇳閱讀原文: TechNode

💡了解中國如何在沒有 GPU 的情況下擴展 exascale 運算,這可能會改變 AI 基礎設施的未來。

⚡ 30-Second TL;DR

有什麼變化

系統僅使用 CPU 架構即可提供 1.54 exaFLOPS 的效能。

為什麼重要

此發展凸顯了透過將高效能 AI 與科學運算工作負載與西方 GPU 供應鏈脫鉤,以實現運算主權的重大推動。

下一步行動

評估您目前的模型訓練或推論管線是否能針對基於 CPU 的叢集進行優化,以減少對稀缺 GPU 資源的依賴。

誰應關注:Developers & AI Engineers

關鍵要點

  • 系統僅使用 CPU 架構即可提供 1.54 exaFLOPS 的效能。
  • 搭載 245 萬個基於 Armv9 指令集的國產 LX2 處理器。
  • 標誌著向以 CPU 為中心的高效能運算轉型,以繞過 GPU 供應限制。

🧠 深度解析

Web-grounded analysis with 17 cited sources.

🔑 增強重點摘要

  • LineShine 超級電腦的中文名稱為「靈晟」,意為「智慧光輝」或「智慧明亮」,於2026年4月在深圳的一次公開活動中發布。
  • 該系統的 1.54 exaFLOPS 效能特指 BF16 訓練性能,其 AI 訓練峰值性能可達 2.16 exaFLOPS,並以超過 2 exaFLOPS 的 FP64 持續性能為目標。
  • LineShine 旨在處理廣泛的工作負載,包括分子模擬、流體動力學、材料設計、大規模 AI 模型訓練、遙感、生物信息學、氣象學、製藥、石油勘探和生命科學等。
  • 該超級電腦運行阿里巴巴開發的與 RHEL 相容的 Anolis OS 8.9 作業系統,並包含 ROCm 相容環境、GCC 8.5.0、rocBLAS 和 PyTorch 2.7.1 等軟體堆疊。
  • LX2 處理器的開發商未公開,但業界推測可能由華為設計或為國家超級計算深圳中心與華為的聯合設計。
📊 競品分析▸ Show
特性/系統LineShine (中國)El Capitan (美國)Frontier (美國)Aurora (美國)Fugaku (日本)
架構純CPUCPU + GPUCPU + GPUCPU + GPUCPU (向量處理器)
主要處理器LX2 (Armv9)AMD Instinct MI300A APUAMD EPYC + AMD Instinct MI250XIntel Xeon Max + Intel Max GPUFujitsu A64FX (Armv8.2-A SVE)
峰值性能 (Rmax/AI)1.54 BF16 exaFLOPS (訓練), 2.16 BF16 exaFLOPS (峰值), 目標 >2 FP64 exaFLOPS1.742 FP64 exaFLOPS (Rmax)1.353 FP64 exaFLOPS (Rmax)1.012 FP64 exaFLOPS (Rmax), 潛力達2 FP64 exaFLOPS0.442 FP64 exaFLOPS (Rmax)
GPU/加速器AMD Instinct MI300AAMD Instinct MI250XIntel Max GPU無 (CPU內建SVE)
國產化程度完全國產部分 (AMD)部分 (AMD)部分 (Intel)完全國產 (Fujitsu)
主要應用科學計算, AI訓練, 工業模擬核武器研究, 科學計算癌症研究, 藥物發現, 核聚變, 材料設計科學工具, 建模模擬, AI科學計算, 氣候建模, 藥物發現
作業系統Anolis OS 8.9 (Linux)LinuxLinuxLinuxLinux

🛠️ 技術深入

  • 系統架構: LineShine 系統由 20,480 個計算節點組成,每個節點配備兩顆 LX2 處理器,全系統共計 40,960 顆 LX2 處理器,總計超過 245 萬個 CPU 核心。
  • LX2 處理器:
    • 基於 Armv9 架構,專為大規模 AI 和 HPC 工作負載優化設計。
    • 每個 LX2 處理器包含 304 個 CPU 核心,分為 8 個集群,每個集群有 38 個核心。
    • 每個核心支援 Arm SVE(可伸縮向量擴展)和 SME(可伸縮矩陣擴展)單元,可高效處理 FP64、FP32、BF16、FP16 和 INT8 等多種數據格式。
    • 單顆 LX2 處理器在 FP64 精度下可提供 60.3 TFLOPS 算力,BF16/FP16 精度下可提供 240 TFLOPS 算力,INT8 精度下可提供 960 TOPS 算力。
    • 採用獨特的記憶體子系統,整合 32 GB 片上 HBM(8 個堆疊,總頻寬約 4 TB/s)和高達 256 GB 片外 DDR5 記憶體。
    • 每個計算晶粒內建專用 SDMA 引擎,負責 DDR 與 HBM 之間數據移動。
  • 互連網路: 採用「靈渠」(LingQi) 高速網路,具備雙平面多軌胖樹拓撲結構,每個節點提供 1.6 Tb/s 的頻寬。
  • 儲存系統: 包含 428 個儲存節點,分佈在 67 個機櫃中,提供 10 TB/s 的聚合頻寬和 650 PB 的總儲存容量,被描述為中國最大的液冷儲存部署。
  • 作業系統: Anolis OS 8.9 (基於 Linux)。
  • 散熱: 採用全液冷散熱方案。

🔮 前景展望AI analysis grounded in cited sources

中國將持續優先發展本土高效能運算技術,以實現技術主權。
LineShine 的純 CPU、完全國產化設計是對美國出口管制的直接回應,顯示中國明確的策略是減少對外國技術的依賴。
針對 AI 和 HPC 優化的 CPU 核心架構將在特定工作負載中獲得更多關注,挑戰 GPU 主導的範式。
LineShine 的架構,憑藉其專用的向量/矩陣擴展和混合記憶體,表明 CPU 可以針對 AI 訓練和科學計算進行高度優化,特別是對於涉及複雜數據移動和不規則控制流的任務,GPU 的優勢可能不那麼明顯。
全球超級電腦領域將出現更多樣化的架構,這將受到地緣政治因素和專業工作負載需求的驅動。
LineShine 作為一個純 CPU 的百億億次級系統的出現,以及現有的 GPU 加速系統和其他基於 Arm 的設計(如 Fugaku),表明超級電腦領域正擺脫單一主導架構,受到國家戰略和特定應用需求的影響。

時間線

2009-05
國家超級計算深圳中心(NSCC-SZ)獲批成立。
2010-05
深圳超算一期系統「星雲」在世界超級電腦 TOP500 排名第二。
2025-12
LineShine 系統完成全系統部署與激活。
2026-04
LineShine 超級電腦項目在深圳的一次公開活動中發布。
2026-04
LineShine 完成全機測試,相關論文曝光架構細節。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechNode