來源較早收集於 7h

Olmo-core 3 開放大型 MoE 訓練基礎設施

閱讀原文: Hugging Face Blog
#mixture-of-experts#model-training#open-infrastructure

開放訓練堆疊可能讓研究者與開發者更容易進行大型 MoE 實驗。

30 秒速覽

有什麼變化

Olmo-core 3 針對大型 MoE 模型的訓練基礎設施。

為什麼重要

開放訓練基礎設施可降低重現與延伸大型模型研究的門檻。其實際價值將取決於文件、硬體效率與社群採用情況。

下一步行動

檢視 Olmo-core 3 儲存庫,並在現有加速器環境上執行其最小 MoE 訓練範例。

誰應關注:Researchers & Academics

關鍵要點

  • •Olmo-core 3 針對大型 MoE 模型的訓練基礎設施。
  • •該專案主打開放性與可擴展性。
  • •提供的文章未說明支援的硬體或訓練 API。
關鍵數字470 億2.7 倍46 億32 億

深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

增強重點摘要

  • •Olmo-core 3 由艾倫人工智慧研究所(Ai2)與華盛頓大學合作研發,並同步釋出開源代碼與技術報告《Supercharging Olmo-core for Efficient and Scalable MoE Training》。
  • •訓練架構從傳統的 FSDP(全分片數據並行)轉移至基於 DDP 的專家路由機制,將專家參數常駐於本地 GPU 顯存中,僅在節點間傳遞 token 與活化值,顯著降低跨節點通訊負擔。
  • •在 8 顆 NVIDIA B300 GPU 節點基準測試中,訓練 470 億參數的 MoE 模型達到每 GPU 每秒 52,000 個 token 的吞吐量,較前代 FSDP 方案提升約 2.7 倍。
  • •專家擴展展現近乎恆定的擴展效率:當專家數量從 8 個擴展至 128 個(總參數從 46 億增至 470 億,每 token 啟用 top-4 專家且活躍參數固定約 32 億)時,吞吐量衰減幅度低於 5%。
  • •支援拓撲無關檢查點(Topology-Agnostic Checkpointing),以全局 FP32 狀態進行匯出與載入,允許訓練作業在變更節點數量或平行化配置的叢集間無縫重啟與退火。

技術深入

  • 底層並行與通訊架構:摒棄每個微批次反覆 gather/reshard 權重的 FSDP 機制,改採常駐本地記憶體的 DDP MoE 路由架構;整合 DeepEP v2 通訊後端,在極限測試下支援達 2.38 兆總參數規模。
  • 超大規模叢集效能:在 512 顆 NVIDIA B300 GPU 叢集上實測 1.2 兆參數 MoE(每 token 活躍參數為 583.6 億),在合成/隨機路由測試中達到每 GPU 858 TFLOP/s 的算力吞吐量。
  • 檢查點機制:採用拓撲無關檢查點技術,能夠解耦儲存狀態與底層硬體拓撲結構,確保跨異質叢集或平行排程變更時的權重無損恢復與續訓。
  • 模型擴展能力:在 top-4 專家選擇策略下,可在保持活躍參數固定的同時將專家總數大幅擴展至 128 個,維持高硬體運算效率。

前景展望基於引用來源的 AI 分析

開放權重前沿 MoE 模型將邁向兆級參數規模
Olmo-core 3 驗證了在 Blackwell 硬體上擴展至 1.2 兆至 2.38 兆參數的可行性,大幅拉近學術與開放機構與閉源巨頭在兆級 MoE 訓練技術上的差距。
分散式 MoE 訓練基礎設施將普遍轉向專家常駐與純 Token 路由設計
該架構透過減少跨節點權重複製實現了 2.7 倍的吞吐量躍升,將促使其他開源訓練框架跟進淘汰全分片數據並行方案。

時間線

2024-02
Ai2 正式發布首代全開源語言模型 OLMo
2024-07
Ai2 推出完全開源的稀疏混合專家模型 OLMoE-1B-7B
2024-11
Ai2 發布密集架構後續版本 OLMo 2
2026-10
Ai2 發表 Olmo-core 3 訓練基礎設施,支援兆級參數 MoE 高效擴展

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。