🔥36氪•較早收集於 5m
國產算力集群成功訓練萬億參數模型
💡國產算力集群已具備萬億參數訓練能力,是AI基礎設施領域的重要訊號。
⚡ 30-Second TL;DR
有什麼變化
五萬卡國產算力集群成功訓練出萬億參數模型。
為什麼重要
在國產硬體上訓練萬億參數模型的能力,降低了對外國晶片的依賴,並加速了本土AI生態系統的獨立性。
下一步行動
評估您的模型在國產算力集群上的表現,以分散基礎設施佈局並降低供應鏈風險。
誰應關注:Developers & AI Engineers
關鍵要點
- •五萬卡國產算力集群成功訓練出萬億參數模型。
- •國產AI系統能力已從推理升維至全流程訓練。
- •受供給約束影響,API服務商開始採用「峰谷定價」機制。
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •此次訓練採用的國產算力集群主要由華為昇騰(Ascend)系列晶片構成,顯示出國產硬體在應對超大規模參數訓練時的穩定性已獲實質性突破。
- •美團在萬億參數模型訓練中,針對國產晶片架構優化了通信庫(如HCCL),有效解決了大規模集群互聯帶來的頻寬瓶頸問題。
- •DeepSeek V4引入的「峰谷定價」機制,旨在通過價格槓桿引導開發者錯峰使用算力,以緩解國產高端GPU產能不足導致的排隊現象。
- •此次技術驗證不僅限於模型訓練,還包括了對國產算力集群在長週期、高並發訓練任務下的斷點續訓與故障恢復能力測試。
- •中信證券分析認為,隨著國產算力集群規模化部署,未來將進一步降低大模型訓練的邊際成本,推動國產AI生態從『可用』向『好用』轉型。
📊 競品分析▸ Show
| 比較維度 | 美團(國產集群) | NVIDIA H100 集群 | 備註 |
|---|---|---|---|
| 訓練規模 | 5萬卡(國產) | 10萬卡+(全球) | 國產集群規模正快速追趕 |
| 互聯技術 | 國產自研互聯協議 | NVLink / NVSwitch | 國產互聯效率仍有優化空間 |
| 成本結構 | 峰谷定價機制 | 市場化競價 | 國產算力具備政策與供應鏈韌性優勢 |
| 生態兼容性 | 昇騰/自研框架 | CUDA生態 | CUDA仍具備絕對生態壁壘 |
🛠️ 技術深入
- 採用分佈式並發訓練策略,結合了數據並行(Data Parallelism)與張量並行(Tensor Parallelism)技術。
- 針對國產晶片架構進行了算子庫深度優化,提升了矩陣乘法運算效率。
- 引入了高效的檢查點(Checkpoint)保存機制,確保在數千張晶片同時運行時的容錯率。
- 優化了集群內部的RDMA通信性能,降低了跨節點數據傳輸的延遲。
🔮 前景展望AI analysis grounded in cited sources
國產算力集群將在2026年底前實現萬卡級別的常態化訓練部署。
美團此次成功訓練萬億參數模型,證明了國產算力集群在超大規模任務上的可行性,將加速企業級算力中心的建設進程。
「峰谷定價」將成為國產算力租賃市場的標準商業模式。
由於國產高端晶片產能短期內難以完全滿足市場需求,通過價格機制優化資源配置是解決供給緊張的必然選擇。
⏳ 時間線
2024-05
DeepSeek發布V2模型,開始探索國產算力適配。
2025-03
美團啟動大規模國產算力集群建設項目。
2026-02
國產算力集群完成萬億參數模型初步驗證。
2026-06
美團正式完成萬億參數模型全流程訓練。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗
每週 AI 簡報
每週一封,可隨時退訂。