🍎最新收集於 15h

資料受限混合預訓練的縮放定律

資料受限混合預訓練的縮放定律
PostLinkedIn
🍎閱讀原文: Apple Machine Learning

💡參考超過 2,000 次實驗,為資料受限的預訓練選擇更佳混合比例。

⚡ 30-Second TL;DR

有什麼變化

研究目標語言或領域資料天生有限時的混合預訓練。

為什麼重要

這些研究結果可協助實務團隊在預訓練期間更有效率地配置有限的領域資料。更理想的資料混合決策,可能在不大幅增加資料蒐集或訓練成本的情況下提升目標領域表現。

下一步行動

執行小規模混合預訓練掃描,調整目標資料比例,並分別監測通用資料集與目標領域資料集的驗證損失。

誰應關注:Researchers & Academics

關鍵要點

  • 研究目標語言或領域資料天生有限時的混合預訓練。
  • 評估稀缺目標資料與大量通用資料之間的平衡。
  • 指出目標資料過少可能使模型無法充分接觸目標領域。
  • 強調過度取樣目標資料會造成重複、效益遞減,最終導致過擬合。
  • 透過超過 2,000 次語言模型訓練實驗探討這項取捨。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 16 個來源。

🔑 增強重點摘要

  • 該研究發現,在混合預訓練中,稀缺的目標領域語料庫可以重複使用高達 15-20 次,遠高於單一來源訓練的重複次數,且通用資料在此過程中扮演了隱式正規化器的角色,有助於維持學習並避免性能下降。
  • Apple Machine Learning 引入了一種「重複感知混合縮放定律」,該定律能夠解釋重複目標詞元價值遞減的現象,並考慮通用資料的正規化作用。
  • 這些縮放定律具有預測能力,可以在小規模實驗中擬合,並精確地推斷至更大規模的模型和未見過的領域權重,從而提供一種系統性的方法來配置有效的混合訓練。
  • 研究驗證了這些縮放定律的普適性,不僅適用於大型語言模型 (LLM),也適用於原生多模態模型 (NMM) 和大型視覺模型 (LVM) 的預訓練。
  • 透過這些縮放定律,可以在給定的訓練預算(模型大小 N 和訓練詞元 D)下推導出任何目標領域的最佳資料權重,取代了傳統耗時且成本高昂的試錯方法。

🛠️ 技術深入

  • 該研究涵蓋了超過 2,000 次語言模型訓練實驗,模型參數規模從 101M 到 805M 不等。
  • 實驗使用了多種資料類型,包括多語言(德語、法語、斯瓦希里語)、多領域(數學、科學論文、維基百科)以及經過品質篩選的混合資料集。
  • 引入的「重複感知混合縮放定律」將目標領域損失建模為目標資料大小、混合比例和模型規模的函數。
  • 此縮放定律建立在領域混合縮放定律 (DMSL) 框架之上,並納入了資料重複的影響,這在任何混合組件資料受限時變得至關重要。
  • 研究發現,通用資料作為一種隱式正規化器,使得混合訓練能夠容忍比單一來源訓練高得多的資料重複次數。
  • 稀缺目標語料庫的最佳重複次數可達 15-20 倍,具體取決於目標資料大小、計算預算和模型規模。
  • 該縮放定律可以在小規模實驗中進行擬合,並外推到更大規模,以準確估計最佳重複次數。

🔮 前景展望AI analysis grounded in cited sources

未來大型語言模型在低資源語言或特定領域的訓練將更具成本效益。
透過精確的縮放定律預測最佳資料混合與重複次數,可減少昂貴的試錯實驗,優化資源分配。
領域適應和持續預訓練的策略將更廣泛地應用於客製化大型語言模型。
該研究提供了一種系統性方法來平衡通用與特定領域資料,有助於在有限資料下提升模型在專業領域的表現。
模型訓練中的資料策劃將從單純的「越多越好」轉向「最佳化混合與重複」。
研究證明過度重複會導致效益遞減和過擬合,而適當的重複和通用資料的正規化作用能顯著提升性能。

時間線

2019-06
Apple Machine Learning Research 發表關於無監督領域適應的研究,旨在彌合不同資料領域之間的差距。
2024-06
Apple 在全球開發者大會 (WWDC) 上推出 Apple Intelligence,並介紹其裝置端與伺服器基礎語言模型。
2025-07
Apple Intelligence Foundation Language Models 技術報告發布,詳細說明其多語言、多模態基礎模型。
2025-07
Apple Machine Learning Research 在 ICML 2025 發表關於微調期間預訓練資料注入以避免遺忘的縮放定律研究。
2025-11
Apple Machine Learning Research 發表研究,指出大型語言模型可用於後期多模態感測器融合以進行活動辨識。
2026-05
Apple Machine Learning Research 發表「資料受限混合預訓練的縮放定律」論文,探討稀缺目標資料與通用資料的混合策略。

📎 來源 (16)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. arxiv.org
  2. arxiv.org
  3. researchgate.net
  4. apple.com
  5. neurips.cc
  6. medium.com
  7. baai.ac.cn
  8. qingkeai.online
  9. xueai.net
  10. apple.com
  11. apple.com
  12. medium.com
  13. apple.com
  14. arxiv.org
  15. apple.com
  16. technews.tw
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Apple Machine Learning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。