⚛️量子位•較早收集於 40m
商湯大裝置重塑 AI 算力叢集

💡商湯 AI 原生時代叢集重構—擴展運算基礎設施關鍵。
⚡ 30-Second TL;DR
有什麼變化
推出 AI 原生算力叢集重新設計
為什麼重要
實現大規模 AI 訓練更高效,降低 AI 企業超大規模運算成本。
下一步行動
探索商湯 AI 原生雲文件,優化基礎設施堆疊叢集。
誰應關注:Enterprise & Security Teams
關鍵要點
- •推出 AI 原生算力叢集重新設計
- •商湯大裝置引領架構革新
- •分享 AI 原生雲部署實踐
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •商湯大裝置(SenseCore)採用了軟硬體協同設計,透過自研的 SenseCore AI 雲平台,實現了對異構算力資源的統一調度與虛擬化管理,顯著提升了大規模模型訓練的資源利用率。
- •該架構針對大模型訓練中常見的網路瓶頸問題,引入了高頻寬、低延遲的互聯技術,並優化了分散式訓練框架,以支援數萬張 GPU 的並行計算需求。
- •商湯大裝置不僅服務於內部模型研發,還透過 AI 原生雲模式向外部企業提供算力租賃與模型訓練服務,推動了行業從「算力堆疊」向「算力效能優化」的轉型。
📊 競品分析▸ Show
| 特性 | 商湯大裝置 (SenseCore) | 阿里雲 (PAI) | 華為雲 (Ascend) |
|---|---|---|---|
| 核心架構 | 軟硬體協同/異構調度 | 雲原生/彈性調度 | 全棧昇騰/自研晶片 |
| 算力生態 | 兼容多種 GPU/自研架構 | 深度綁定 NVIDIA/自研 | 昇騰生態/封閉架構 |
| 適用場景 | 大模型訓練/推理優化 | 企業級 AI 應用/雲服務 | 國產化替代/大規模訓練 |
🛠️ 技術深入
- 採用異構算力池化技術,支援 NVIDIA GPU 與國產 AI 晶片的混合調度。
- 實施了多層級的網路拓撲優化,降低了大規模分散式訓練中的 All-Reduce 通訊開銷。
- 整合了自動化模型並行策略(如流水線並行、張量並行),自動適配不同規模的參數模型。
- 具備動態資源彈性伸縮能力,支援在訓練過程中進行節點故障自動恢復與熱遷移。
🔮 前景展望AI analysis grounded in cited sources
商湯將進一步提升國產 AI 晶片在 SenseCore 中的佔比。
為應對國際供應鏈限制,商湯必須透過軟體層面的優化來提升國產硬體的訓練效能。
AI 原生雲服務將成為商湯營收結構中的核心支柱。
隨著大模型應用普及,企業對高效能、低成本算力基礎設施的需求將持續增長。
⏳ 時間線
2022-01
商湯科技正式發布 SenseCore 商湯 AI 大裝置。
2023-04
商湯推出「日日新」大模型體系,並基於大裝置進行大規模訓練。
2024-07
商湯大裝置算力規模進一步擴容,支援萬卡級別的並行訓練任務。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
每週 AI 簡報
每週一封,可隨時退訂。