🐯最新收集於 11m

Marin 公開直播訓練 535B MoE 模型

Marin 公開直播訓練 535B MoE 模型
PostLinkedIn
🐯閱讀原文: 虎嗅
#mixture-of-experts#foundation-models#open-trainingmarin-535b-a23bmarinstanford crfmnvidiagb200andrew ng

💡一個 535B 模型正公開訓練,揭露通常被嚴格保密的資料、程式碼、指標與失敗結果。

⚡ 30-Second TL;DR

有什麼變化

Marin 535B-A23B 約有 5350 億個總參數,每個 Token 約啟用 230 億個參數。

為什麼重要

Marin 將大規模模型訓練從封閉的企業流程,轉變為可公開檢視的實驗。若能成功,將為研究者與獨立開發者提供更具參考價值、可重現且由社群共同參與的基礎模型開發模式。

下一步行動

追蹤 Marin 的 GitHub 儲存庫與 W&B 儀表板,並在較小型的專家模型上重現其 4K 上下文路由與 Token 丟棄率測試。

誰應關注:Researchers & Academics

關鍵要點

  • Marin 535B-A23B 約有 5350 億個總參數,每個 Token 約啟用 230 億個參數。
  • 專案計畫將 18.75 兆個 Token 中的 80% 用於預訓練、20% 用於中期訓練,之後再進行後訓練。
  • 訓練運行於 11 套 NVIDIA GB200 NVL72 系統,預計需要約三個月。
  • Marin 的開放實驗室流程會公開 GitHub Issue、程式碼、Pull Request、W&B 指標、資料、配方、失敗結果與中途修改。
  • 團隊透過 pooled/wave expert parallelism,在 4K 上下文長度下將 MoE 的 Token 丟棄率降至約 3%。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • 該專案由史丹佛大學教授 Percy Liang 領導,並與其創立的 Simile AI 密切相關,旨在推動 AI 開發的極致透明化。
  • 訓練過程透過 Weights & Biases (W&B) 平台即時公開關鍵指標,包括模型浮點運算利用率 (MFU) 與吞吐量數據。
  • 此專案與 Percy Liang 的學術課程《CS336: Language Models From Scratch》教學目標高度整合,作為大型模型構建的實踐案例。
  • Marin 專案被視為對抗封閉式模型開發趨勢的指標性開放科學計畫,常與 T-Rex 觸覺操作堆疊等開放研究並列討論。
  • 硬體配置涉及 792 個 NVIDIA GB200 GPU,透過 11 套 NVL72 系統進行大規模叢集運算。
📊 競品分析▸ Show
特性Marin 535B-A23BLlama 3.1 (405B)Mixtral 8x22B
開放程度全程公開訓練歷程權重開放 (非訓練過程)權重開放
架構MoE (535B/23B)Dense (405B)MoE (141B/39B)
訓練透明度極高 (公開失敗與修正)低 (僅公開最終報告)
算力規模11x GB200 NVL7216K+ H100未公開

🛠️ 技術深入

  • 採用混合專家模型 (MoE) 架構,總參數達 5350 億,單一 Token 啟用 230 億參數。
  • 實作 pooled/wave expert parallelism 技術,有效降低 MoE 訓練中的 Token 丟棄率至 3%。
  • 訓練環境基於 11 套 NVIDIA GB200 NVL72 系統,總計 792 個 GPU 節點。
  • 訓練流程包含 18.75 兆 Token,分配比例為 80% 預訓練與 20% 中期訓練,隨後進入後訓練階段。
  • 支援 4K 上下文長度下的高效能運算,並透過即時監控 MFU 確保訓練穩定性。

🔮 前景展望AI analysis grounded in cited sources

開放訓練流程將成為學術界大型模型開發的標準規範。
Marin 專案的成功公開將迫使其他學術機構在爭取研究經費時,必須提供更高程度的訓練透明度。
MoE 架構的 Token 丟棄率優化將提升未來大規模模型的訓練效率。
該專案公開的 pooled/wave expert parallelism 實作細節將直接降低其他開發者在訓練 MoE 模型時的硬體門檻。

時間線

2026-08
Marin 535B-A23B 專案正式啟動並公開訓練流程與程式碼。

📎 來源 (6)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. 36kr.com
  2. latent.space
  3. htx.com
  4. wandb.ai
  5. latent.space
  6. wiredframe.xyz
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。