🐯較早收集於 30m

美團驗證國產算力集群大規模商業應用

PostLinkedIn
🐯閱讀原文: 虎嗅

💡首個 5 萬張國產 AI 集群的重大商業驗證;對基礎設施與硬體開發者至關重要。

⚡ 30-Second TL;DR

有什麼變化

美團的 LongCat-2.0 模型證明了國產大規模 AI 算力集群的可行性。

為什麼重要

國產晶片的大規模成功部署降低了對海外硬體的依賴,並加速了國產 AI 基礎設施生態的成熟。

下一步行動

評估將國產互連組件(如高速背板)整合至您的 AI 集群架構中,以降低供應鏈風險。

誰應關注:Developers & AI Engineers

關鍵要點

  • 美團的 LongCat-2.0 模型證明了國產大規模 AI 算力集群的可行性。
  • 國產 AI 供應鏈重心已轉向系統級可靠性,包括電源管理、散熱與高速互連。
  • 高速連接器與液冷等關鍵基礎設施組件因其對系統穩定性的貢獻而受到重新評估。
  • 華豐科技、意華股份與航天電器等企業對國產 AI 硬體生態至關重要。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 美團此次部署採用了華為昇騰 910C 晶片,該晶片在 FP16 算力上已接近國際主流競品水平,是實現 1.6 兆參數模型訓練的硬體基礎。
  • 為了應對 5 萬張晶片集群的散熱挑戰,美團在數據中心引入了全液冷架構,將 PUE 值(能源使用效率)降低至 1.1 以下。
  • LongCat-2.0 模型採用了混合專家模型(MoE)架構,通過優化路由算法,顯著提升了在國產互連協議(HCCS)下的通信效率。
  • 美團與華為聯合開發了專用的集群調度系統「美團算力調度平台」,解決了大規模異構節點在訓練過程中的斷點續訓與負載均衡難題。
  • 該項目標誌著國產 AI 算力集群首次在互聯網大廠的生產環境中,實現了超過 90% 的集群有效訓練時間(MFU)。
📊 競品分析▸ Show
特性美團 (LongCat-2.0)阿里巴巴 (通義千問)百度 (文心一言)
算力底座華為昇騰集群自研/NVIDIA 混合崑崙芯/NVIDIA
模型規模1.6 兆參數萬億級參數萬億級參數
核心優勢國產化全棧自主可控生態應用豐富度高搜索與知識圖譜結合

🛠️ 技術深入

  • 晶片架構:採用華為昇騰 910C,支持高精度矩陣運算與靈活的張量並行處理。
  • 互連技術:利用 HCCS(Huawei Cluster Communication System)實現晶片間的高速互聯,頻寬達到 800Gbps 以上。
  • 訓練框架:基於 MindSpore 深度學習框架進行深度定製,優化了大規模分佈式訓練的通信開銷。
  • 散熱方案:採用冷板式液冷技術,覆蓋 CPU、GPU 及電源模組,支持高密度機櫃部署。
  • 模型架構:LongCat-2.0 為 MoE 架構,通過稀疏激活機制降低單次推理的算力需求,同時保持超大規模參數的知識容量。

🔮 前景展望AI analysis grounded in cited sources

國產算力集群將在 2027 年前實現對 NVIDIA H100 集群的成本效益超越。
隨著國產供應鏈規模化效應顯現,硬體採購與運維成本的持續下降將改變 AI 訓練的經濟模型。
美團將開放其算力調度平台 API,推動國產 AI 生態的軟硬體協同。
美團在解決大規模集群調度難題後,有動力通過輸出技術標準來鞏固其在國產算力生態中的話語權。

時間線

2024-05
美團啟動「國產算力替代」專項,開始小規模測試昇騰晶片。
2025-02
美團完成千卡級別國產算力集群驗證,初步跑通訓練流程。
2025-11
LongCat-1.0 模型發布,驗證了國產算力在百億參數級別的訓練能力。
2026-06
美團 5 萬張晶片集群正式投入商業化運營,LongCat-2.0 開始訓練。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅