📚最新收集於 0m

535B 大模型訓練全面公開

535B 大模型訓練全面公開
PostLinkedIn
📚閱讀原文: InfoQ中国
#large-language-model#open-training#reproducibility535b-大模型535b-modelandrew-ng

💡了解 535B 模型如何公開記錄數月訓練,以及程式碼、資料與 Loss 曲線。

⚡ 30-Second TL;DR

有什麼變化

該模型擁有 5350 億個參數。

為什麼重要

公開訓練資產有助於提升研究可重現性,並協助研究人員分析大規模模型訓練。這也可能提高外界對未來基礎模型專案透明度的期待。

下一步行動

檢視其公開的訓練程式碼、資料集文件與 Loss 曲線,並將專案的擴展行為與你自己的 LLM 實驗進行比較。

誰應關注:Researchers & Academics

關鍵要點

  • 該模型擁有 5350 億個參數。
  • 訓練過程連續三個月以公開直播方式進行。
  • 專案公開了程式碼、訓練資料與 Loss 曲線。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • 該專案由史丹佛大學基礎模型研究中心(CRFM)發起,旨在透過公開訓練過程來消除大型模型開發的「黑箱」疑慮。
  • 模型正式名稱為 Marin 535B-A23B,總訓練規模預計處理 18.75 兆個 Token。
  • 硬體基礎設施採用 11 組 NVIDIA GB200 NVL72 系統,總算力需求約為 2.7 × 10²⁴ FLOPs。
  • 訓練資料分配策略為 80% 用於預訓練(Pre-training),20% 用於中途訓練(Mid-training)。
  • 此專案由 Percy Liang 與 David Hall 領導,代表了學術界對抗封閉模型開發趨勢、推動開放科學的指標性運動。
📊 競品分析▸ Show
特性Marin 535B-A23B封閉式商業模型 (如 GPT-4/Claude 3)
訓練透明度完全公開 (即時 Loss/資料配方)不公開
權重存取開放研究權限僅限 API 存取
訓練架構揭露 (GB200 NVL72)保密
基準測試社群協作驗證內部評測

🛠️ 技術深入

  • 模型架構:Marin 535B-A23B 參數規模為 5350 億。
  • 運算資源:部署 11 組 NVIDIA GB200 NVL72 叢集進行分散式訓練。
  • 訓練規模:總計 18.75 兆 Token 的訓練量。
  • 訓練策略:採用 80/20 的預訓練與中途訓練資料配比。
  • 透明化機制:即時串流訓練 Loss 曲線、模型配置參數與技術討論紀錄。

🔮 前景展望AI analysis grounded in cited sources

學術界將建立大型模型透明度的新標準
Marin 專案的成功公開將迫使未來的大型模型開發者在發布時提供更多關於訓練過程的元數據以維持競爭力。
硬體供應商將更重視開源研究的算力支持
此專案展示了學術機構利用高階 GPU 叢集進行大規模公開訓練的可行性,將推動 NVIDIA 等廠商對學術研究提供更多資源傾斜。

時間線

2025-05
史丹佛大學 CRFM 正式對外宣布 Marin 開放基礎模型專案。
2026-05
Marin 535B-A23B 啟動為期三個月的公開直播訓練流程。

📎 來源 (6)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. 36kr.com
  2. chaspark.com
  3. htx.com
  4. latent.space
  5. github.com
  6. aibase.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: InfoQ中国

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。