
資料受限混合預訓練的縮放定律
Apple Machine Learning 研究如何在語言模型預訓練期間,將稀缺的目標領域資料與大量通用資料混合。該研究涵蓋超過 2,000 次訓練實驗,分析目標資料暴露不足、樣本重複、效益遞減與過擬合之間的取捨。
Tag: #overfitting6 results

Apple Machine Learning 研究如何在語言模型預訓練期間,將稀缺的目標領域資料與大量通用資料混合。該研究涵蓋超過 2,000 次訓練實驗,分析目標資料暴露不足、樣本重複、效益遞減與過擬合之間的取捨。
Zhang et al. 2016顯示標準NN與SGD在真實標籤上泛化,但在隨機標籤上記憶,違反VC維度與Rademacher複雜度。挑戰統計學習理論解釋深度網的主導地位。此文標誌DL理論樂觀危機。
作者指出 QLoRA 常用的 2e-4 學習率是針對大型數據集(50k+)優化的,在小型數據集(小於 10k)上容易導致過擬合。將學習率調降至 1e-4 或更低,能顯著提升小型微調任務的評估表現。

開發者在使用 Keras Tuner 的 Hyperband 演算法進行價格預測時,遇到了異常的學習曲線和 1.00 的 R2 分數。該貼文尋求社群建議,以釐清這是程式碼錯誤還是模型過度擬合所致。

本文以量化交易中機器學習的過擬合概念,解釋為何擅長理性化歷史的專家常無法預測未來。它將複雜模型擬合噪音,比作人類從有限經驗產生的偏見,缺乏泛化能力。建議包括隔離經驗並尋求反證,以改善決策。
基準測試因過擬合不可靠,實際品質有差。搜尋僅得 AI 垃圾文、基準、無共識 Reddit 討論、餌頭影片。尋求 2026 年優質評測來源。