🤖Reddit r/MachineLearning•最新收集於 62m
Bart 推出 2.82B 參數復古語料 LLM

💡探索僅以 1931 年前英文訓練的開放 28.2 億參數 LLM,以及全新的歷史文本基準測試。
⚡ 30-Second TL;DR
有什麼變化
Bart 擁有 28.2 億參數,使用 1931 年前撰寫的 201 億個英文 token 訓練。
為什麼重要
Bart 提供了一個成本相對低廉且可重現的研究平台,用來探討語言模型是否能從受歷史時代限制的知識中推理,而不只是預測現代語言的後續內容。其開放的基準測試與資料集有助於比較領域特定預訓練策略,但受限的語料範圍也限制了它直接用於通用部署的價值。
下一步行動
先從 Hugging Face 下載 jbduran/bart-sft,並使用公開的 Vintage CORE 評估工具測試 Bart,再進行歷史領域微調實驗。
誰應關注:Researchers & Academics
關鍵要點
- •Bart 擁有 28.2 億參數,使用 1931 年前撰寫的 201 億個英文 token 訓練。
- •團隊建立 Vintage CORE,這是一套專為歷史文本訓練模型設計、包含 20 個基準測試的評估套件。
- •Unbounded Labs 開源了 41.6 萬組以 1930 年代以前資料為依據的人工評分問答對,用於監督式微調。
- •最終模型在單張 H100 上訓練五天,MFU 全程約維持在 60%。
- •專案宣稱 Bart 在 Vintage CORE 上是同規模最佳的復古基礎模型,表現超越 GPT-1900。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 2 個來源。
🔑 增強重點摘要
- •訓練資料來源主要取自哈佛大學的機構圖書館藏書,原始語料庫經清洗後從 2420 億 token 縮減至 230 億 token。
- •該專案的研發動機源於 DeepMind 執行長 Demis Hassabis 提出的挑戰,旨在探討 LLM 是否能重現歷史科學家的推論過程。
- •開發團隊在訓練過程中利用單張 H100 進行了 10 小時的自主研究,成功執行 100 次實驗並識別出 26 項模型改進方案。
- •整個專案採取極致精簡的預算策略,總開發成本僅約 807 美元,展示了小型團隊在特定領域的訓練效率。
- •Bart 的訓練過程不僅是為了效能,更作為一項學術實驗,旨在透過從零構建模型來深入理解大型語言模型的內部運作機制。
📊 競品分析▸ Show
| 特性 | Bart (Unbounded Labs) | GPT-1900 |
|---|---|---|
| 參數規模 | 28.2 億 | 未公開 |
| 訓練語料 | 1931 年前 (201 億 token) | 歷史文本 |
| 基準測試 | Vintage CORE | 通用基準 |
| 訓練成本 | 約 807 美元 | 未公開 |
🛠️ 技術深入
- 模型架構:採用從零開始訓練的 Transformer 架構,針對歷史語料進行最佳化。
- 訓練效率:在單張 NVIDIA H100 GPU 上訓練 5 天,維持 60% 的 MFU (Model Flops Utilization)。
- 語料處理:從 2420 億 token 的原始歷史文本中,經過嚴格清洗與篩選,最終保留 201 億 token 用於訓練。
- 監督式微調:使用 41.6 萬組基於 1930 年代前資料的人工評分問答對進行 SFT。
- 自主優化:利用自動化實驗流程,在 10 小時內完成 100 次參數與架構調整實驗。
🔮 前景展望AI analysis grounded in cited sources
歷史領域專用模型將成為學術研究的新標準
透過 Vintage CORE 等專用基準測試,研究人員能更精確地評估 AI 在特定歷史語境下的邏輯推論能力。
低預算訓練將推動小型實驗室的 AI 創新
Bart 專案證明了在低於 1000 美元的成本下,透過高效的資料清洗與自動化實驗,即可訓練出具備競爭力的垂直領域模型。
⏳ 時間線
2026-08
Unbounded Labs 正式發布 Bart 模型及 Vintage CORE 基準測試
📎 來源 (2)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。