🐯虎嗅•最新收集於 11m
Marin 公開直播訓練 535B MoE 模型

#mixture-of-experts#foundation-models#open-trainingmarin-535b-a23bmarinstanford crfmnvidiagb200andrew ng
💡一個 535B 模型正公開訓練,揭露通常被嚴格保密的資料、程式碼、指標與失敗結果。
⚡ 30-Second TL;DR
有什麼變化
Marin 535B-A23B 約有 5350 億個總參數,每個 Token 約啟用 230 億個參數。
為什麼重要
Marin 將大規模模型訓練從封閉的企業流程,轉變為可公開檢視的實驗。若能成功,將為研究者與獨立開發者提供更具參考價值、可重現且由社群共同參與的基礎模型開發模式。
下一步行動
追蹤 Marin 的 GitHub 儲存庫與 W&B 儀表板,並在較小型的專家模型上重現其 4K 上下文路由與 Token 丟棄率測試。
誰應關注:Researchers & Academics
關鍵要點
- •Marin 535B-A23B 約有 5350 億個總參數,每個 Token 約啟用 230 億個參數。
- •專案計畫將 18.75 兆個 Token 中的 80% 用於預訓練、20% 用於中期訓練,之後再進行後訓練。
- •訓練運行於 11 套 NVIDIA GB200 NVL72 系統,預計需要約三個月。
- •Marin 的開放實驗室流程會公開 GitHub Issue、程式碼、Pull Request、W&B 指標、資料、配方、失敗結果與中途修改。
- •團隊透過 pooled/wave expert parallelism,在 4K 上下文長度下將 MoE 的 Token 丟棄率降至約 3%。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •該專案由史丹佛大學教授 Percy Liang 領導,並與其創立的 Simile AI 密切相關,旨在推動 AI 開發的極致透明化。
- •訓練過程透過 Weights & Biases (W&B) 平台即時公開關鍵指標,包括模型浮點運算利用率 (MFU) 與吞吐量數據。
- •此專案與 Percy Liang 的學術課程《CS336: Language Models From Scratch》教學目標高度整合,作為大型模型構建的實踐案例。
- •Marin 專案被視為對抗封閉式模型開發趨勢的指標性開放科學計畫,常與 T-Rex 觸覺操作堆疊等開放研究並列討論。
- •硬體配置涉及 792 個 NVIDIA GB200 GPU,透過 11 套 NVL72 系統進行大規模叢集運算。
📊 競品分析▸ Show
| 特性 | Marin 535B-A23B | Llama 3.1 (405B) | Mixtral 8x22B |
|---|---|---|---|
| 開放程度 | 全程公開訓練歷程 | 權重開放 (非訓練過程) | 權重開放 |
| 架構 | MoE (535B/23B) | Dense (405B) | MoE (141B/39B) |
| 訓練透明度 | 極高 (公開失敗與修正) | 低 (僅公開最終報告) | 低 |
| 算力規模 | 11x GB200 NVL72 | 16K+ H100 | 未公開 |
🛠️ 技術深入
- 採用混合專家模型 (MoE) 架構,總參數達 5350 億,單一 Token 啟用 230 億參數。
- 實作 pooled/wave expert parallelism 技術,有效降低 MoE 訓練中的 Token 丟棄率至 3%。
- 訓練環境基於 11 套 NVIDIA GB200 NVL72 系統,總計 792 個 GPU 節點。
- 訓練流程包含 18.75 兆 Token,分配比例為 80% 預訓練與 20% 中期訓練,隨後進入後訓練階段。
- 支援 4K 上下文長度下的高效能運算,並透過即時監控 MFU 確保訓練穩定性。
🔮 前景展望AI analysis grounded in cited sources
開放訓練流程將成為學術界大型模型開發的標準規範。
Marin 專案的成功公開將迫使其他學術機構在爭取研究經費時,必須提供更高程度的訓練透明度。
MoE 架構的 Token 丟棄率優化將提升未來大規模模型的訓練效率。
該專案公開的 pooled/wave expert parallelism 實作細節將直接降低其他開發者在訓練 MoE 模型時的硬體門檻。
⏳ 時間線
2026-08
Marin 535B-A23B 專案正式啟動並公開訓練流程與程式碼。
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。
