Search

Tag: #overfitting6 results

🤖

QLoRA 的 2e-4 學習率通常設定過高

作者指出 QLoRA 常用的 2e-4 學習率是針對大型數據集(50k+)優化的,在小型數據集(小於 10k)上容易導致過擬合。將學習率調降至 1e-4 或更低,能顯著提升小型微調任務的評估表現。

Reddit r/MachineLearningCommunityJul 16#fine-tuning#overfitting