Search

Tag: #fine-tuning102 results

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

在 GSM8K 上以 RLVR (GRPO) 及 SFT 訓練 Qwen2.5-1.5B-Instruct;RLVR 提升數學推理 +11.9 分,甚至單例也改善無關 MATH。SFT 則惡化 -15.2 分。基準測試 388 檢查點,資料在 HF Spaces/GitHub。

Reddit r/MachineLearningCommunityMar 3#fine-tuning#reasoning#rlhf
Amazon Nova 強化微調解析

Amazon Nova 強化微調解析

AWS 介紹 Amazon Nova 模型的強化微調 (RFT),透過評估反饋學習而非模仿。內容涵蓋 RFT 機制、與監督微調比較、如程式碼生成與客戶服務的應用,以及透過 Amazon Bedrock 或 Nova Forge 的實作方式。提供資料準備與獎勵函數設計的最佳實務建議。

AWS Machine Learning BlogOfficialFeb 26#fine-tuning#agentic-workflows
鎖定開放權重模型,防止未授權微調

鎖定開放權重模型,防止未授權微調

Apple Machine Learning 提出 Deep Low-Rank Residual Distillation,一種旨在提高預訓練語言模型權重抗修改能力的研究方法,以降低未授權用途的適配風險。這項工作回應了開放權重模型帶來的研究與部署優勢,與其可能被任意修改及重新散布之間的矛盾。

Apple Machine LearningOfficialAug 6#weight-protection#fine-tuning
🤖

QLoRA 的 2e-4 學習率通常設定過高

作者指出 QLoRA 常用的 2e-4 學習率是針對大型數據集(50k+)優化的,在小型數據集(小於 10k)上容易導致過擬合。將學習率調降至 1e-4 或更低,能顯著提升小型微調任務的評估表現。

Reddit r/MachineLearningCommunityJul 16#fine-tuning#overfitting
Page 5 of 11